LLM – всё?

Сижу я значит, работаю, никого не трогаю. И захотелось вынести на всеобщее обсуждение некоторые мысли.

Я уже некоторое время как отказался от подписок на нейросети и экспериментирую с роутерами, то и дело тестируя разные модели в разных задачах. И в последнее время начинаю всё больше удивляться одному интересному факту.

Мы(те, кто интересовался ИИ ещё до массового внедрения и помешательства) жили несколько лет в парадигме того, что фронтирные большие модели - это круто. Куда ни плюнь, каждый месяц выходит обновление «Клауд файбле x.y» или другой помойки из семейства проприетарных гигантов и весь интернет начинает ссать кипятком.

Но вот что интересно. Создается ощущение, что стоимость обучения и эксплуатации больших моделей растет настолько быстро, что экономика дальнейшего их масштабирования начинает вызывать вопросы. Причем растет не только стоимость создания модели. Растет стоимость каждого её следующего вызова. И когда модель должна отвечать не тысячи, а миллионы раз, вопрос «а точно ли нам нужны эти сотни миллиардов параметров?» становится вполне обоснованным. Потому что тупо масштабировать параметры модели до бесконечности не просто не получится, но и в целом, откровенно говоря, стратегия довольно стремная.

Разумеется, я не претендую на место главного умника и многие владельцы моделей уже это смекнули. С одной стороны, появилась архитектура MoE, позволяющая делать гигантские модели вычислительно эффективнее. С другой - все активнее развиваются маленькие специализированные модели, которые отлично умеют делать что-то одно.

В этот момент большая языковая модель становится учителем для более маленьких, позволяя делать сильно эффективные модели с не таким уж и тяжелым инференсом(Mistral, к слову на этом свой бизнес построил).

Ведь реально важно не столько то, что знает исходная модель, сколько то, насколько ты способен обогатить её контекст правильной информацией. И инструментов для этого огромное количество. Конечно, всё зависит от обертки, контура, тулзов которые вы ей даете. Но всё же.

Я уже месяц плотно мучаю Flash модели разных провайдеров и могу уверенно сказать несколько вещей:

 - Мой расход на токены снизился в несколько раз - Я практически не заметил потери качества в типовых задачах. Если мне нужно сложное планирование или экспертиза, сложные рассуждения, я по прежнему использую большие модели - В подавляющем большинстве задач гиганты мне больше не нужны

Возможно, мы немного неправильно ставили вопрос всё это время. Не «какая модель умнее?», а «какая модель достаточно умна для этой конкретной задачи?». Потому что если одна модель за X денег решает задачу хорошо, а другая за 0.1X решает её так же хорошо, то для реального потребителя победитель очевиден.

Скорее, большая модель постепенно превращается в станок по производству маленьких моделей. И это куда интереснее, чем капать слюной на бенчмарки, которые в реальных задачах, оказывается, не очень то и в тему.

P.S. Моя персональная боль идеалиста и «хорошего мальчика».

Желаю всем воздуханам в интернетах постепенно попасть в забвение после фраз «Эта новая модель только что убила все остальные», «Используй этот навык для Клауд кода и делай монтаж лучше, чем моушн-дизайнер» и всех подобных им.

LLM – всё? | Сетка — социальная сеть от hh.ru