Какая нейросеть умнее? Разбираемся без хайпа
Вчера задал DeepSeek провокационный вопрос: «Ты умнее Kimi K3?» Kimi K3 — одна из самых обсуждаемых китайских моделей от Moonshot AI, вокруг которой в последние дни поднялся настоящий ажиотаж. Её появление вызвало обвал на американском фондовом рынке на полтриллиона долларов. Вокруг Kimi K3 столько шума, что складывается ощущение, будто она перевернула весь рынок искусственного интеллекта. Очень похоже на момент появления DeepSeek в январе 2025 года.
Как обычно DeepSeek дал конкретный ответ, вместо общих фраз разложив по полочкам возможности, скорость, стоимость и сценарии использования обеих моделей. Kimi K3 действительно производит сильное впечатление. Это одна из самых мощных моделей, когда-либо созданных китайскими разработчиками. Она демонстрирует высокие результаты в независимых тестах, отлично справляется со сложными задачами по программированию, умеет работать не только с текстом, но и с изображениями и уверенно конкурирует с лучшими западными моделями.
Если смотреть исключительно на бенчмарки, спорить сложно — Kimi K3 сегодня находится среди мировых лидеров. Хотелось потестировать, но бесплатный чат-бот Kimi из-за наплыва пользователей не работал.
Так всё же насколько нужны обычным пользователям эти супермощные модели от ИИ-стартапов? Мы точно уверены, что для написания статьи или генерации открытки нам нужен весь вес Kimi K3 в 2,8 триллиона (2.8T) параметров? И 2,799 триллиона уже не хватит? Мне лично, Kimi всегда было пользоваться неудобно, и появление супермощной модели K3 ничего не изменило.
Полагаю, дело не в трилионах параметров и не в масштабе. Если сравнивать с той же DeepSeek, то можно увидеть, что в этом случае компания-разработчик подходит к развитию модели с совершенно иной философией. Вместо того чтобы наращивать масштаб любой ценой, разработчики сделали ставку на эффективность. Модель меньше по размеру, работает быстрее, обходится значительно дешевле и при этом остаётся полностью открытой.
Так кто же умнее? По чистой производительности и результатам тестов Kimi K3 действительно сильнее. Но слово «умнее» само по себе мало что означает. Если человек профессионально занимается программированием, строит сложные программные системы или решает действительно тяжёлые инженерные задачи, Kimi K3, думаю, выглядит хорошим выбором.
Если же основная работа связана с текстами, аналитикой, поиском информации, подготовкой документов, написанием статей или массовой генерацией контента, преимущества того же DeepSeek становятся заметнее. Он быстрее отвечает, стоит в сотни раз дешевле и при этом для большинства повседневных задач разница в качестве оказывается далеко не такой большой, как можно подумать после просмотра рейтингов.
Какая-то нейросеть лучше всех кодит в стиле «сделаю вам микросервисную архитектуру за один промпт». Другая пишет тексты так, что редактор плачет от счастья. Третья лучше всех переводит с испанского. Четвёртая создаёт качественную инфографику, в то время как у всех остальных ничего не получается. А пятая просто приятна в общении и понимает вас с полуслова, и к тому же, в отличие от других, у неё есть чувство юмора.
И дело здесь не в мощности модели, не в триллионах параметров, а в специализации. В том, как именно разработчики обучали нейросеть, на каких данных, с каким акцентом и под какие сценарии использования.
Именно поэтому погоня за самой «умной» моделью далеко не всегда имеет смысл. Потому что эти триллионы параметров — они как лошадиные силы под капотом. Да, впечатляет. Да, звучит круто. Но гигантский объём параметров не гарантирует, что она справится с вашей конкретной задачей лучше, чем более скромная, но узко заточенная модель.
Тестируйте модели на своих задачах. Один и тот же запрос разные нейросети решают по-разному. Лучший способ выбрать — прогнать через них реальные кейсы из повседневной работы.
И не будем забывать про силу привычки. Иногда мы работаем с определённой нейросетью просто потому, что привыкли к ней, знаем её сильные и слабые стороны, освоили её промптинг. И это тоже нормально: удобство и предсказуемость порой ценнее преимущества в бенчмарке.