Новый аргумент Яндекса

Летом Герман Греф сказал, что Яндекс дообучает китайский Qwen. Яндекс не стал долго объясняться и выложил AliceAI Foundation. 80 млрд параметров — это, конечно, тоже способ сказать «мы услышали вашу обратную связь».

Посмотрел сегодня, вот какие соображения.

1. Модель на 80B параметров — но работать на каждом токене будут только 3B. Оригинальность не в отдельных деталях. MoE, attention и линейные слои - все известно. Оригинальна их комбинация.

Обычно LLM либо дорого гоняет full attention по всему тексту, либо экономит на линейной архитектуре. Здесь смешали оба подхода: большинство слоёв — быстрые KDA + MoE, а периодически включается более дорогой Gated Attention, чтобы модель не теряла сложные связи в длинном контексте. То есть модель большая по знаниям, но пытается быть дешевле в инференсе. Не «новая физика», но свой архитектурный рецепт.

2. С топовыми западными моделями пока мериться рано. Claude, GPT и Gemini — закрытые, дообученные продуктовые модели. У Яндекса — сырой base checkpoint: мозг есть, но HR, безопасность и умение не хамить клиенту ещё не завезли. По открытым бенчмаркам он местами конкурирует с не самыми новыми NVIDIA Nemotron и китайскими Qwen/DeepSeek.

3. Контекст — 262K токенов. Влезет договор, переписка, годовой отчёт и все 47 версий презентации «AI-стратегия 2026». Модель прочитает. Руководство всё равно попросит сократить до одного слайда.

4. Россия всё ещё не США и не Китай по количеству своих моделей. За 2025 год США выпустили 59 заметных AI-моделей, Китай — 35, Южная Корея — 8. Но российский список хотя бы перестал состоять из одного Сбера и бесконечных разговоров про суверенность. Теперь в споре «Яндекс просто дообучает китайцев» появился аргумент, который весит примерно 160 ГБ в BF16.

5. Нужны примерно 4 GPU по 80 ГБ. То есть это не «поставим локально на ноутбук CEO». Это «сначала позовите инфраструктурщиков, потом CFO, потом снова инфраструктурщиков».

Суть: это не убийца Claude, а открытая российская модель для компаний, которые хотят строить AI внутри контура, на русском и под свои данные. Open source, кстати, не значит бесплатно. Просто теперь счёт за эксперимент придёт не в долларах за API, а в рублях за GPU, электричество и зарплаты людей, которые будут чинить всё это по ночам.

Новый аргумент Яндекса | Сетка — социальная сеть от hh.ru