LLM – всё?
Сижу я значит, работаю, никого не трогаю. И захотелось вынести на всеобщее обсуждение некоторые мысли.
Я уже некоторое время как отказался от подписок на нейросети и экспериментирую с роутерами, то и дело тестируя разные модели в разных задачах. И в последнее время начинаю всё больше удивляться одному интересному факту.
Мы(те, кто интересовался ИИ ещё до массового внедрения и помешательства) жили несколько лет в парадигме того, что фронтирные большие модели - это круто. Куда ни плюнь, каждый месяц выходит обновление «Клауд файбле x.y» или другой помойки из семейства проприетарных гигантов и весь интернет начинает ссать кипятком.
Но вот что интересно. Создается ощущение, что стоимость обучения и эксплуатации больших моделей растет настолько быстро, что экономика дальнейшего их масштабирования начинает вызывать вопросы. Причем растет не только стоимость создания модели. Растет стоимость каждого её следующего вызова. И когда модель должна отвечать не тысячи, а миллионы раз, вопрос «а точно ли нам нужны эти сотни миллиардов параметров?» становится вполне обоснованным. Потому что тупо масштабировать параметры модели до бесконечности не просто не получится, но и в целом, откровенно говоря, стратегия довольно стремная.
Разумеется, я не претендую на место главного умника и многие владельцы моделей уже это смекнули. С одной стороны, появилась архитектура MoE, позволяющая делать гигантские модели вычислительно эффективнее. С другой - все активнее развиваются маленькие специализированные модели, которые отлично умеют делать что-то одно.
В этот момент большая языковая модель становится учителем для более маленьких, позволяя делать сильно эффективные модели с не таким уж и тяжелым инференсом(Mistral, к слову на этом свой бизнес построил).
Ведь реально важно не столько то, что знает исходная модель, сколько то, насколько ты способен обогатить её контекст правильной информацией. И инструментов для этого огромное количество. Конечно, всё зависит от обертки, контура, тулзов которые вы ей даете. Но всё же.
Я уже месяц плотно мучаю Flash модели разных провайдеров и могу уверенно сказать несколько вещей: - Мой расход на токены снизился в несколько раз - Я практически не заметил потери качества в типовых задачах. Если мне нужно сложное планирование или экспертиза, сложные рассуждения, я по прежнему использую большие модели - В подавляющем большинстве задач гиганты мне больше не нужны
Возможно, мы немного неправильно ставили вопрос всё это время. Не «какая модель умнее?», а «какая модель достаточно умна для этой конкретной задачи?». Потому что если одна модель за X денег решает задачу хорошо, а другая за 0.1X решает её так же хорошо, то для реального потребителя победитель очевиден.
Скорее, большая модель постепенно превращается в станок по производству маленьких моделей. И это куда интереснее, чем капать слюной на бенчмарки, которые в реальных задачах, оказывается, не очень то и в тему.
P.S. Моя персональная боль идеалиста и «хорошего мальчика».
Желаю всем воздуханам в интернетах постепенно попасть в забвение после фраз «Эта новая модель только что убила все остальные», «Используй этот навык для Клауд кода и делай монтаж лучше, чем моушн-дизайнер» и всех подобных им.
· 6 ч
А может попробовать другие "технологии" ? Зачем обучать "модели" на очень больших объемах некачественный данных и тратить на подобное обучение много средств и ресурсов, если можно подготовить качественные данные? Что не правильно в этой идее?
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён
· 6 ч
Синтетические датасеты, которые генерируются для обучения более маленьких моделей действительно могут быть не самыми качественными с точки зрения их "энциклопедийности". Но, насколько я понимаю, сейчас вектор обучения идёт не в сторону раздувания общего объема материала, а к улучшению способностей к "размышлению", качеству вызовов инструментов и корректному обогащению контекста. Тут все карты в руках пользователя, а не только разработчиков
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 3 ч
Вообще-то я про другое... Про LLM типа Алисы, Гиги и ТД. Их знания берутся из интернета заполненного мусором более чем на 90% и с каждым годом "мусора" становится всё больше (контент-фабрики и блого-заводы выдают мусор непрерывно) Научить "ии" способности "размышления" вряд-ли получится - пока ещё нет знания того, как это делает человек - но явно не на каком-то разговорном языке Вот поэтому я и говорю о том, что этот путь тупиковый. О том, что нужна другая технология.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 3 ч
Тогда всё еще не понял суть предложения. В чём фундаментальное отличие Алисы, Гигачата и прочих? Зачем их пробовать?
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 1 ч
Отличие в построении всего не на "словах", а на "смыслах" подробнее по ссылке https://walks.ru/text/kri.html
возможно там много лишних слов, но всё же...
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 1 ч
Поздравляю, вы придумали слабо связный граф. А в чем посыл то?
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 10 мин
Да ладно? Правда что-ли я придумал? А я заблуждался, что всё придумано давно, а я только собрал вместе... И, некстати, не только я... но другие не могут выпустить свою разработку в мир - однако "корпоративная тема"
Ну да ладно... Вам это видимо не нужно.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён