Короче, делюсь апдейтом по проекту

Изначально я сидел на OpenRouter, но там лимиты - просто слезы. 50 запросов в сутки - это вообще ни о чем, для нормального теста бота не хватает. Понял, что так далеко не уеду, и начал искать более вменяемые варианты.

В итоге психанул и полностью переписал весь AI-модуль. Теперь у меня в связке Groq и Google AI Studio, оттуда вытащил три разные модели: ⁠Llama 3.3⁠ (основная), ⁠Llama 3.1⁠ (метрики и фоллбэк) и ⁠Gemini 3.1 Flash Lite⁠ (дайджесты и фоллбэки).

Что изменилось:

- Полностью пересобрал логику взаимодействия с API. Теперь это не просто запрос-ответ, а каскадная система, которая сама рулит потоками.

- Реализовал умные ретраи через ⁠tenacity⁠. Теперь если сеть лагает или провайдер отдает ошибку - бот не падает, а делает несколько попыток.

- Написал жесткие фоллбеки. Если основной провайдер упирается в лимиты или отваливается - бот бесшовно переключается на запасную модель прямо во время диалога.

- После смены провайдеров и моделей, скорость ответов AI в боте увеличилось в разы. OpenRouter с free моделями очень долго давал ответ, а с фоллбэками ответ бота мог исчисляться минутами - сейчас же ответы почти моментальные (максимум пару секунд) при том же качестве.

- Помимо этого была еще масса изменений, от новых микро фич, до косметических изменений и переоформления логов.

По итогу стало в разы стабильнее, бот теперь не отваливается в самый неподходящий момент, а юзер просто получает готовый ответ.

Какие связки моделей сейчас используете, чтобы не упираться в потолок и не разориться на подписках? Возможно вы знаете еще какие-то мало известные провайдеры бесплатных API, буду рад почитать.