Новый leaderboard для AI-агентов: score есть, proof еще нет

IBM Research выкатили Open Agent Leaderboard на Hugging Face. ⠀ Интересная часть там не в том, какой агент занял первое место. ⠀ Интересная часть в другом: они сравнивают не просто модели, а целые агентские системы. ⠀ То есть модель плюс обвязка вокруг нее: планирование, инструменты, память, контекст, поведение при ошибках, стоимость выполнения задачи. ⠀ Это важный сдвиг. ⠀ Потому что в реальной разработке команда покупает не оценку модели. Команда получает рабочий процесс, где агент читает репозиторий, выбирает инструменты, пробует путь, ошибается, повторяет, тратит бюджет и в конце приносит какой-то результат. ⠀ И вот тут появляется привычный ложный сигнал. ⠀ Агент хорошо выглядит в leaderboard. ⠀ Звучит как proof. ⠀ Но для команды это еще не ответ на главный вопрос. ⠀ Можно ли принимать его работу в реальном workflow? ⠀ В статье есть хорошая деталь: провальные запуски в их экспериментах стоили на 20-54% дороже успешных. Это ровно та зона, которую часто не видно в красивых демо. ⠀ Ошибка агента может быть дорогой не потому, что он написал плохой код. ⠀ А потому что он долго шел по неверному пути, жег токены, дергал инструменты, накапливал артефакты и только потом стало понятно, что результат не принят. ⠀ Поэтому я бы смотрел на такие leaderboard не как на рейтинг победителей, а как на начало нормального разговора о reliability. ⠀ Что важно проверять рядом со score: ⠀ Сколько стоит принятый результат. ⠀ Где агент обычно ломается. ⠀ Как быстро он останавливается на неверном пути. ⠀ Какие инструменты он выбирает сам. ⠀ Кто проверяет, что результат соответствует исходной задаче. ⠀ Есть ли след проверки, а не только финальный ответ. ⠀ Benchmark показывает, что агент может сделать в стандартизированной среде. ⠀ Командный workflow должен показать другое: можно ли доверять результату, стоимости и границам выполнения. ⠀ Сигнал настоящий. ⠀ Вывод все еще надо доказать. ⠀ Какая метрика для AI-агентов вам кажется важнее обычного success rate: стоимость запуска, качество proof, скорость остановки на ошибке или доля принятых изменений?

Новый leaderboard для AI-агентов: score есть, proof еще нет | Сетка — социальная сеть от hh.ru