Клод, Гемини или GPT? Про архитектуру и технические особенности

Обожаю текстовые нейросети, вот прям каждый день ими пользуюсь. Уже около года как.

Началось все с попыток закодить приложения. Потом личные проблемы начал обсуждать. Затем я начал кидать в чат вообще все - записи рабочих встреч, свои идеи, свои страхи - и получать мнение со стороны. И это помогло расти.

И за этот год я очень хорошо разобрался в особенностях каждой нейросети, и оказывается – они очень разные.

GPT-5.2 Декодинг идет через дерево поиска (MCTS), строго разделяя логику и язык. Отсюда идеальная структурность ответов. Окно контекста 400к, но если общаться в chatgpt – то старый контекст будет сжиматься и приобретать меньший вес в ответе.

Claude Opus 4.6 Декодинг происходит через гораздо менее жесткую обрезку вероятностей ответа, он буквально "думает" всем объемом параметров сразу. Окно контекста – 1 млн токенов – не сжимается агрессивно, сохраняя как глубину стиля для текстов, так и максимум входных деталей в ответе.

Gemini 3.1 Pro Полностью мультмодальная модель – что дает нативное понимание видео, картинок, аудио итд. Агрессивный прунинг (удаление "неважных" токенов из кэша на лету) дает офигенную скорость, но заставляет модель терять детали. Обучена на максимизацию эмпатии, потому что оценивают модели люди, а продактам гугла нужно преследовать метрики)). Из-за этого ответы скатываются в липкий, убеждающий сейлз-вайб, что на мой взгляд омерзительно вкупе с пропуском деталей. Но у этого есть и свои плюсы – о них в следующем посте расскажу.

Бонус трек – Дипсики

Deepseek 3.1 (актуальный) Архитектурно – прорыв в свое время (Смесь экспертов, вместо монолитной). Но из за агрессивного сжатия – часто склеивает факты воедино, что приводит к галюцинациям. В то же время, это агрессивное сжатие делает ее супер-дешевой, и посему – бесплатной.

И слухи про DeepSeek-V4, который выйдет скоро: Общий вес раздуют до 1 триллиона параметров (почти как у американских моделей), но активных параметров на токен станет даже меньше, чем в V3. Т.е модель станет умнее, но еще дешевле в инференсе. DSA (DeepSeek Sparse Attention): Нативный контекст на 1 млн токенов. Судя по слитым бенчмаркам, это будет офигенный конкурент Claude Sonnet и GPT 5.3 Codex для кодинга. Ждем!