Новая модель — только начало.

Обучать модели с нуля — Да! Яндекс выпустил AliceAI-Foundation-80B-A3B-Base.

Екатерина Редина — Открываем AliceAI-Foundation-80B-A3B-Base — новую языковую модель Яндекса, обученную с нуля

Модель построена на архитектуре Mixture of Experts: при каждом запросе используется только небольшая часть параметров. Основной претрейн прошёл на 17,5 трлн токенов, а максимальный контекст модели — 128K токенов.

Это именно базовая модель до посттрейна, поэтому сравнивать её результаты напрямую с готовыми ChatGPT, Claude или Gemini некорректно. Стартовый поинт, так сказать.

И, конечно, коментарии всех мастей про «закрытые контуры», «правительственные системы», «суверенное обучение». Ну чего я только не наслушался и не начитался сегодня.

Кажется, упускается самое важное. «Обучение моделей» — это очень сложная и чудовищно дорогая технология и весьма непростой процесс. И пока ты строишь свой собственный конвеер и при этом не зарабатываешь на этом деньги, нуууу... ты топишь ассигнациями котел, обогревающий атмосферу.

Но есть точка, когда хотя бы на бумаге становится понятно, что экономика может начать сходиться. Чтобы сегодня модель вышла, решение по обучению моделей было принято не вчера. И тем, кто продолжает вести наблюдение, конечно, следует это учитывать.