Когда я училась в МИФИ, то у нас был факультет К (кибернетика), узнав что они занимаются искусственным интеллектом, я смеялась в голос. Ну а теперь я пишу посты про ИИ. Лох, что сказать)))

Ниже материал в первую очередь для техно-гиков, но важные выводы из него стоит понять уже сейчас.

И первый вывод, не верь слепо все что тебе говорят! Ищи пути!

Сегодня многие ИИ-модели развиваются по одному и тому же сценарию: чем больше данных, токенов и вычислительных мощностей, тем лучше результат. Но у такого подхода есть цена — он требует огромных ресурсов.

Немного в теорию: модель учится на последовательном предсказании токенов (помните Т9) и фактически «перебирает» колоссальные объемы информации, чтобы просто продолжать следующий шаг текста или изображения.

Проблема в том, что масштабирование через бесконечное увеличение мощностей не всегда дает качественный скачок. Это работает, но становится все дороже, медленнее и тяжелее для инфраструктуры.

Именно поэтому исследователи в жилах которых еще живет авантюризм ищут другие подходы: не просто наращивать размер моделей, а учить их эффективнее представлять и предсказывать мир на более абстрактном уровне. То есть думать как мы.

Один из таких путей — JEPA-подход и его развитие в LeWorldModel. Суть в том, чтобы модель училась не воспроизводить все подряд пиксель за пикселем, а предсказывать более смысловые, компактные представления.

Они показывают модель примерно на 15 млн параметров, которую можно обучить за несколько часов на одной GPU. А по скорости планирования она работает до 48 раз быстрее, чем некоторые современные world models.

Подробности — в документе во вложении.