ИИ обогнал людей в реальной офисной работе. Но есть нюанс 🤖📉
Тут команда исследователей выкатила бенчмарк ApprenticeBench. Вместо синтетической духоты из серии «реши 500 задач с литкода» авторы смоделировали реальный онбординг сотрудника. Взяли строительную компанию Acme Home Builders, реальную ERP-систему, годовой поток входящих документов и посадили агентов на позицию бухгалтера по расчетам с поставщиками.
Задача: разгребать инвойсы, матчить позиции со сметами, разбираться с кривыми сканами, вести переписку с вендорами и адаптироваться к правилам компании, которые никто прямо в промпте не разжевывает.
Цифры на первый взгляд — мечта любого стартапера: флагманы в лице Fable 5.1 (72%) и GPT-6 Astra (68%) вчистую переиграли живых опытных специалистов (лучший человек набрал всего 51%).
Казалось бы, пора открывать шампанское и увольнять бухгалтерию? Ха-ха.
1️⃣ Юнит-экономика вышла в окно Человек-бухгалтер (по медианной ставке в США ~$26/час) обходился компании в $7.21 за обработанную задачу. Агент на Fable 5.1 с максимальным reasoning сжирает токенов на $18.23 на ту же самую задачу. То есть «дешевая замена кожаным мешкам» прямо сейчас обходится бизнесу в 2.5 раза дороже живого сотрудника.
2️⃣ Человек с опытом ускоряется, агент — деградирует Люди устроены так: первые 10 инвойсов ты тупишь в регламенты, а к сотому закрываешь задачу за 11–16 минут. Сеткам для долговременной памяти прикрутили систему заметок в Markdown. И что произошло? GPT-6 Astra к концу теста накатала 22 000 слов в 61 файле, а Fable 5.1 — 192 000 слов в 122 файлах! В итоге человек работает все быстрее, а агент — всё медленнее (время на задачу улетает за 25–31 минуту), потому что на каждом шаге он вынужден переваривать гигантские простыни собственного лога.
3️⃣Спам-атака на коллег Агенты отправляют в 3.7–4.4 раза больше сообщений, чем минимально необходимо по регламенту (люди держатся в районе 1.9–2.0x). Агент заваливает контрагентов и менеджеров лишними письмами, уточнениями и переспросами. В реальной компании такой «инициативный джун» парализует работу смежных отделов за два дня.
4️⃣Обработка проблемных кейсов Приходит агенту на вход неразборчивый скан инвойса на 90 DPI. Что делает нормальный человек за 2 минуты? Пишет поставщику: «Коллеги, скан плохой, пришлите нормальный PDF». Что сделал агент? Он 1 час 51 минуту упорно писал на чистом Python собственный алгоритм деконволюции Ричардсона–Люси и посимвольный шаблонный матчер, чтобы восстановить пиксели! Скрипт упал по таймауту, агент перезапустился, еще 50 минут поковырялся, сдался... и в итоге просто написал вендору письмо с просьбой прислать нормальный документ! Вместо решения бизнес-задачи за пару кликов пишем свой велосипед на коленке, в итоге все равно приходим к такому же результату 😁
В итоге: с одной стороны круто, модельки уже могут решать многие человеческие задачи. С другой стороны — между «агент технически может» и «агент выгоден для бизнеса» лежит пропасть из раздутых контекстов, стоимости инференса, архитектуры памяти и банального здравого смысла.
Как вам идея платить за софт в 2.5 раза больше, чем живому сотруднику, ради шильдика "AI-driven"?
· 54 мин
А чай кто пить будет, тоже агенты?
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён