🇨🇳 Китайцы снова переворачивают игру

Вышла DeepSeek-V3.2. Если верить бенчмаркам (и их золотым медалям на IMO и IOI 2025), то мы получили весá, которые работают на уровне (или лучше) GPT-5 и Gemini 3.0 Pro.

Что важного?

1️⃣ Они разделили линейку: 🟢 DeepSeek-V3.2: Универсал. Умеет в тулинг, агенты и вот это всё. 🟢DeepSeek-V3.2-Speciale: Чистый "мозг". Специализированная версия для глубокого ризонинга. В тестах она уделывает GPT-5, НО у неё вырезали поддержку tool-calling. Вообще. То есть, хотите думать — берите Speciale. Хотите делать — берите базу. Архитектурно это оправдано, но в продакшене добавит головной боли с маршрутизацией запросов.

2️⃣ DeepSeek Sparse Attention (DSA) Они выкатили новый механизм внимания. Суть: снижение вычислительной сложности на длинных контекстах без потери качества. Если это реально работает так, как описано в тех. отчете, то стоимость инференса на длинных контекстах упадет кратно.

3️⃣ Новая роль: developer В схему ролей (User, Assistant, System) добавили роль developer. Она эксклюзивна для сценариев поисковых агентов. Официальное API сообщения с этой ролью не принимает, это чисто внутренняя механика для файн-тюнинга и локального запуска сложных пайплайнов.

Как всё быстрооооооо.

🇨🇳 Китайцы снова переворачивают игру
Вышла DeepSeek-V3.2. Если верить бенчмаркам (и их золотым медалям на IMO и IOI 2025), то мы получили весá, которые работают на уровне (или лучше) GPT-5 и Gemini 3 | Сетка — социальная сеть от hh.ru