Новости за последний час

Сбер выкатил в open source GigaChat 3.5 Ultra — 432-миллиардную модель под MIT. По описанию это гибрид GatedDeltaNet и MLA, который внутри компании гоняли на большом числе экспериментов; заявлены улучшения в коде, математике, агентных сценариях и на аренах.

Интересно, что модель при этом стала меньше GigaChat 3.1 Ultra, а не просто «раздулась» ради красивой цифры. Сбер отдельно обещает более компактный KV-кеш, больший контекст, ускорение генерации и FP8-обучение без потери качества относительно bf16. Для open source это редкий случай, когда у релиза есть не только маркетинг, но и довольно конкретная инженерная начинка.

Исследователи ещё предложили JustGRPO для диффузионных языковых моделей: на RL-этапе генерация принудительно идёт слева направо, чтобы не терять качество рассуждений из-за свободного порядка токенов. Авторы пишут про 89.1% на GSM8K и 45.1% на MATH-500 — похоже, у диффузионных LLM сейчас начинается нормальная дисциплина, а не только экзотика.

А вот Claude снова ловит знакомая претензия от пользователя: его приходится просить переделывать задачу много раз, потому что модель упускает детали. Это уже не про «плохой промпт», а про обычную цену работы с LLM: быстро полезно, но до точности часто добираются итерациями.

Источники: Нейроканал, gonzo-обзоры ML статей, The Verge, GPT/ChatGPT/AI Central Александра Горного

Все новости: ai.popovs.tech

#Anthropic #Claude #LLM


В этом посте были ссылки, но мы их удалили по правилам Сетки