Даа, давненько я такого ажиотажа при релизе новых моделек не видел.

Grok 4.1 буквально пару дней продержался в топе на lmarena 😄

И вот мы имеет нового лидера в задачах написания кода. Да и вообще во всех задачах 😅

В сети уже куча отзывов по типу "в один запрос сгенерил операционку/игру/whatever". Делим, конечно, это все на двое, но качество, судя по всему, прямо хорошее.

Причем инструменты взаимодействия с api тоже привносят новенькое. Самые важные нюансы:

1️⃣ Контроль над "мышлением" (Thinking Level) Больше не нужно писать в промпте всякое по типу Let's think step by step. Модель делает это нативно. Но Google, в отличие от конкурентов, дала нам рубильник thinking_level: 🔵low: Быстро, дёшево, для простых задач (чат, суммаризация). 🔵high (default): Глубокий ризонинг.

2️⃣ thoughtSignature Gemini 3 теперь возвращает не просто текст, а зашифрованный слепок своего мыслительного процесса — thoughtSignature. Если вы делаете последовательный диалог или Function Calling, вы обязаны возвращать этот слепок обратно модели в следующем запросе. Это значит, что просто хранить историю сообщений в списке словарей [{role: user, content: …}] больше недостаточно. Нужно таскать за собой этот "мыслительный багаж".

3️⃣ Забудьте про temperature < 1.0 🌡 Мы привыкли: хочешь детерминированный код/JSON — ставь температуру 0. С Gemini 3 (как и с o1) это антипаттерн. Reasoning-модели ломаются при низкой температуре, начинают зацикливаться и выдавать дичь. Рекомендация Google строгая: оставляйте 1.0. Контроль предсказуемости теперь лежит на плечах самого процесса рассуждений.

4️⃣ Смерть сложного промпт-инжиниринга В документации прямым текстом сказано: упрощайте. Gemini 3 (как и o1) начинает галлюцинировать или овер-анализировать, если вы пытаетесь скармливать ей старые шаблоны с жесткими инструкциями по рассуждению. Было: "Ты эксперт, проанализируй А, потом Б, сделай вывод В…" Стало: "Найди race condition в этом куске кода".

Google делает ставку на то, что "думать" модель должна внутри "черного ящика", а разработчик должен управлять лишь ресурсами (уровнем мышления).

Короче, в помойку часть моих рекомендации, которые я даю на эфирах 🤣 Пока только для пары моделей, но все же. Вот и рассказывайте потом, что скиллы работы с LLM и знание конкретных нюансов каждой из них не важны.

Даа, давненько я такого ажиотажа при релизе новых моделек не видел.
Grok 4.1 буквально пару дней продержался в топе на lmarena 😄
И вот мы имеет нового лидера в задачах написания кода | Сетка — социальная сеть от hh.ru