Яндекс выложил в Opensource собственную модель на 80 миллиардов параметров
AliceAI-Foundation-80B-A3B-Base обучена полностью с нуля. Архитектура MoE из 512 экспертов. На каждый токен активируются 3 млрд параметров из 80, контекст — 262 тысячи токенов. Модель — претрейн, ассистента из коробки нет. Лицензия Apache 2.0.
Основная суть и преимущество — лучшее знание русскоязычного контекста. На вопросах про связанные с Россией факты модель обходит всех, с кем сравнивалась, включая DeepSeek-V4-Flash на 284 миллиарда параметров (в 3 раза больше Яндекса). Заодно выложили и два бенчмарка, по которым они себя сравнивали.
Это второй opensource релиз за 2 недели, 11 сентября Яндекс выкладывал Alice AI Search Pretrain (35 миллиардов параметров). Если это не совпадение, а начало новой традиции — огромное им спасибо. Открытые веса это хорошо, конкуренция среди них — это прекрасно. Надеюсь, и открытый ассистент не за горами.
https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base