Бенчмарки для соцсетей, токены для прода: на чём на самом деле крутится LLM-индустрия 📊
Если слушать пресс-релизы техногигантов, можно подумать, что весь IT-мир сидит на флагманских моделях OpenAI и Anthropic.
Но если открыть реальную статистику на OpenRouter, то реальный продакшен выглядит совершенно иначе.
🔵В топе по объёму использованных токенов на первом месте с гигантским отрывом сидит DeepSeek V4.1 Flash. Также в топе GLM 5.3 Flash, Hy4 от Tencent и внезапно ворвавшийся в топ MiMo-V2.6-Flash.
А что там хвалёный Anthropic? По доле запросов — скромные 2.7%. У OpenAI — около 18%. Почему? Потому что когда у тебя в продакшене крутятся реальные объёмы данных, разница в стоимости инференса в 5–10 раз мгновенно убивает любую юнит-экономику.
🔵Посмотрите на топ приложений, сжигающих объемы: Hermes Agent, Cline, Kilo Code, Claude Code. Сейчас основной потребитель токенов — автономные агенты, которые читают репозитории, делают десятки tool calls, правят код, гоняют тесты и падают в бесконечные циклы дебага. Если на сессию из 50+ шагов натравить условный тяжелый Opus или топовый GPT, вы останетесь без штанов до того, как агент смерджит первый пулреквест.
🔵Означает ли это, что топовые флагманы умерли? Нет. В бенчмарках интеллекта верхние строчки плотно оккупировали Claude Opus 5.5, Claude Sonnet 5.5 и GPT-6 Astra. Только дорогущие модели держат исключительно для верхнеуровневого планирования и разруливания сложнейших тупиков. А 95% черновой работы делают быстрые и дешевые китайцы.
Какую сами связку сейчас используете? Или вы из тех, кто купил максимальную подписку на Claude, думая, что это сэкономит больше денюжек, чем грамотная обвязка и оркестрация? 😏