Когда я училась в МИФИ, то у нас был факультет К (кибернетика), узнав что они занимаются искусственным интеллектом, я смеялась в голос. Ну а теперь я пишу посты про ИИ. Лох, что сказать)))
Ниже материал в первую очередь для техно-гиков, но важные выводы из него стоит понять уже сейчас.
И первый вывод, не верь слепо все что тебе говорят! Ищи пути!
Сегодня многие ИИ-модели развиваются по одному и тому же сценарию: чем больше данных, токенов и вычислительных мощностей, тем лучше результат. Но у такого подхода есть цена — он требует огромных ресурсов.
Немного в теорию: модель учится на последовательном предсказании токенов (помните Т9) и фактически «перебирает» колоссальные объемы информации, чтобы просто продолжать следующий шаг текста или изображения.
Проблема в том, что масштабирование через бесконечное увеличение мощностей не всегда дает качественный скачок. Это работает, но становится все дороже, медленнее и тяжелее для инфраструктуры.
Именно поэтому исследователи в жилах которых еще живет авантюризм ищут другие подходы: не просто наращивать размер моделей, а учить их эффективнее представлять и предсказывать мир на более абстрактном уровне. То есть думать как мы.
Один из таких путей — JEPA-подход и его развитие в LeWorldModel. Суть в том, чтобы модель училась не воспроизводить все подряд пиксель за пикселем, а предсказывать более смысловые, компактные представления.
Они показывают модель примерно на 15 млн параметров, которую можно обучить за несколько часов на одной GPU. А по скорости планирования она работает до 48 раз быстрее, чем некоторые современные world models.
Подробности — в документе во вложении.