Автономный агент всё ещё работает под присмотром
Если сотрудник полностью закрывает 63% задач, мы обычно не говорим: «Отлично, дальше можно не проверять». С ИИ эта логика почему-то работает хуже.
Есть свежий бенчмарк PPT-Eval. В нём 120 реалистичных задач по созданию и редактированию PowerPoint. В исходном эксперименте лучший GUI-агент полностью выполнил 45% задач. Средний балл с учётом частичного прогресса составил 57%.
На 14 августа официальный лидерборд уже показывает 63%. Прогресс заметный, но 37% задач всё равно не выполнены полностью. Ну допустим, агент выполняет больше половины работы. Это полезно? Конечно. Можно ли назвать его автономным и уйти пить кофе? Я бы пока не торопился.
И ошибка в оставшейся части может быть не мелочью: неверная цифра, потерянный объект или вывод, которого не было в исходных данных. Поэтому готовый с виду файл всё равно нужно открыть и проверить.
Поэтому я бы использовал более честную шкалу: 1. Черновик. 2. Помощник. 3. Агент под присмотром. 4. Автономный агент.
Я бы пока поставил большинство систем между вторым и третьим пунктом. Это уже полезный рабочий инструмент. Просто слово «автономный» немного опережает испытательный срок. Источник: [PPT-Eval, лидерборд] https://microsoft.github.io/ppteval/leaderboard/