💻 КОД ДЕШЕВЛЕ, РЕЗУЛЬТАТ БЫСТРЕЕ Нейросеть для программирования научилась тратить меньше шагов и денег, не превращая задачу в бесконечный сеанс «сейчас ещё подумаю». Cognition выпустила SWE-2 — и главный сюрприз здесь не только в бенчмарках, но и в цене. 🧠 НОВИНКА БЕЗ ТУМАНА • 🧠 Новая модель от Cognition В SWE-2 компания называет свою самую мощную модель для программирования. Она решает задачи с кодом, а не просто накидывает случайные фрагменты.
• 🏆 Почти догнала Fable 5.1 В тесте FrontierCode 1.1 модель набрала 50%. Это близко к результату Fable 5.1, но SWE-2 работает на 64% дешевле.
• 🚀 С терминалом у неё всё серьёзно В Terminal-Bench 2.1 результат составил 92,8%. Судя по цифре, командная строка для модели — не тёмный лес.
• 🎯 Меньше шагов на задачу SWE-2 medium использует на 58% меньше шагов, чем SWE-1.7. Меньше итераций — меньше времени на ожидание результата.
• 🧠 Под капотом большая база Модель построена на Kimi K3 с 2,8 трлн параметров и обучалась с втрое большим числом тренировочных окружений. 🔥 ГДЕ ЗДЕСЬ ВАУ-ЭФФЕКТ? ▸ Главный козырь — стоимость Средняя цена выполнения задачи снизилась на 81%. Для команд, которые часто гоняют ИИ по коду, это может заметно изменить расчёты 💸
▸ Модель быстрее находит нужное SWE-2 лучше понимает, какие части проекта нужно изучить, и раньше переходит к написанию кода. Не читает весь проект как роман Толстого 🧭
▸ Качество стало доступнее В FrontierCode 1.1 SWE-2 набрала 50%, уступив Fable 5.1, но при меньшей стоимости. Получается не самый дорогой инструмент может быть достаточно сильным для практических задач ⚖️
▸ Глубина рассуждений меняется по ситуации Модель сама выбирает, когда задаче нужен подробный анализ, а когда хватит более быстрого решения. Не каждая правка требует диссертации 🎚
▸ Снижается цена масштабирования Если модель действительно сохраняет заявленную экономию, запускать больше задач становится проще. Но реальные расходы всё равно зависят от конкретных проектов и сценариев 📉 💼 ЧТО ЭТО ИЗМЕНИТ ДАЛЬШЕ? ▸ Разработчики смогут чаще отдавать ИИ рутину Потенциальный сценарий: агент получает задачу в кодовой базе, находит нужные файлы и готовит изменения. Человеку остаётся проверить результат, а не вручную собирать каждый кусок 🔧
▸ Legacy-код станет удобнее разбирать Потенциальный сценарий: SWE-2 ищет связанные места в старом проекте и помогает подготовить рефакторинг. Ограничение прежнее — итоговый код всё равно нужно тестировать 🧹
▸ Маленькие команды получат больше попыток Потенциальный сценарий: при меньшей стоимости команда запускает больше проверок, исправлений и экспериментов. Это не отменяет инженеров, но может убрать часть механической работы 👥
▸ Доступ уже есть не везде SWE-2 доступна в Devin Desktop и CLI. Devin Web заявлен на будущее, а Fusion получает модель постепенно ⏳
▸ Соревнование уйдёт в эффективность Похоже, одних красивых процентов качества разработчикам будет мало. Важными станут скорость, число шагов и стоимость каждой задачи 🏁 🔹🔹🔹🔹🔹🔹 🏆 ЛУЧШИЕ ПРОМПТЫ В PROJECT POOL 🤖 ИИ АГЕНТЫ — собери своего 📈 ИИ-агенты. - просто и понятно #новости #news #нейросети #ии
В этом посте были ссылки, но мы их удалили по правилам Сетки