Нашел способ легально работать с LLM в 2 раза дешевле
У OpenAi и Google есть прикольная фича в API — батчи. Возможно, и у Клода есть, но я не смотрел.
Прикол в том, что вы можете не отправлять свой запрос сразу в модельку, а добавить его в условную очередь — батч. В очереди копятся запросы от кучи людей — и ваши, и Питера из Оклахомы, и Клауса из Германии.
Когда у провайдера падает загрузка серверов и появляется свободная мощность, он берет батч и обрабатывает все запросы оптом. И рассылает результаты и вам, и Питеру, и Клаусу
Время ожидания — до 24 часов. У Гугла вроде до 48 часов. Но на десятках тестах я ни разу не ждал дольше 5 минут.
Ну и самое приятное. За то, что вы не перегружаете сервера, а готовы подождать, провайдеры обрабатывают батчи в 2 раза дешевле, чем обычные запросы.
Получается, если результат вам нужен не прям сразу, то можно пользоваться API со скидкой 50%. Не для всех задач это подойдет, но для некоторых — почему нет.
Я вот прикрутил эту функцию к своему ботику для генерации картинок — @imagine_picbot
В нем появился медленный режим, который отдает картинку не сразу, а в течение 24 часов (по факту на тестах ждать приходилось не дольше 5 минут). Но в 2 раза дешевле. Работает и в обычных генерациях, и в режиме портретов. Пробуйте!