Нашел способ легально работать с LLM в 2 раза дешевле

У OpenAi и Google есть прикольная фича в API — батчи. Возможно, и у Клода есть, но я не смотрел.

Прикол в том, что вы можете не отправлять свой запрос сразу в модельку, а добавить его в условную очередь — батч. В очереди копятся запросы от кучи людей — и ваши, и Питера из Оклахомы, и Клауса из Германии.

Когда у провайдера падает загрузка серверов и появляется свободная мощность, он берет батч и обрабатывает все запросы оптом. И рассылает результаты и вам, и Питеру, и Клаусу

Время ожидания — до 24 часов. У Гугла вроде до 48 часов. Но на десятках тестах я ни разу не ждал дольше 5 минут.

Ну и самое приятное. За то, что вы не перегружаете сервера, а готовы подождать, провайдеры обрабатывают батчи в 2 раза дешевле, чем обычные запросы.

Получается, если результат вам нужен не прям сразу, то можно пользоваться API со скидкой 50%. Не для всех задач это подойдет, но для некоторых — почему нет.

Я вот прикрутил эту функцию к своему ботику для генерации картинок — @imagine_picbot

В нем появился медленный режим, который отдает картинку не сразу, а в течение 24 часов (по факту на тестах ждать приходилось не дольше 5 минут). Но в 2 раза дешевле. Работает и в обычных генерациях, и в режиме портретов. Пробуйте!