💻 Новые тесты показывают, что ведущие модели AI всё ещё не готовы к автоматизации сложных профессиональных задач. Что произошло: Появился свежий независимый benchmark Apex-Agents, который оценивает способности AI-агентов решать реальные задачи из банковской, юридической и консультационной практики. В тестах такие модели, как Gemini 3 Flash, ошибаются более чем в 75 % случаев при выполнении многозадачных профессиональных запросов, где требуется работать с разными инструментами и источниками данных. Это значит, что пока они далеко не готовы заменить специалистов в сложных профессиях.
Что это значит на практике❓: • Современные LLM-агенты способны эффективно отвечать на вопросы, но теряют эффективность на комплексных корпоративных задачах, которые требуют цепочки действий в нескольких системах. • Это явный сигнал, что AI ещё не готов автоматизировать работу специалистов в консалтинге, финансах и праве, несмотря на маркетинговые заявления. • Инвестиции в агентные системы будут смещаться к повышению надежности, интеграции с инструментами и объяснимости решений. • Подобные результаты подталкивают компании пересмотреть ожидания от AI-агентов в production-окружении. • Это уменьшает риск преждевременной автоматизации сложных бизнес-процессов и ставит акцент на гибридной модели: человек + AI. Как это применить в бизнесе❓: Если вы планируете внедрять AI-агентов в рабочие процессы, оценивайте не только точность ответов, но и способность модели действовать в сложных многошаговых сценариях с API, базами данных и внутренними системами. Оцените пилоты на реальных рабочих задачах, прежде чем масштабировать решение.