ИИ-агент справился один раз. Это еще не надежность
В работе с ИИ-агентами есть опасный момент: один удачный запуск легко принять за улучшение всей схемы. ⠀ Ты меняешь модель, инструкцию, память или правила доступа к инструментам. Запускаешь задачу. Агент справляется. ⠀ На вид - шаг вперед. ⠀ Но один успешный запуск доказывает меньше, чем кажется. ⠀ Он подтверждает, что в этом конкретном сценарии агент дошел до результата: с этими входными данными, с этим человеком рядом, с этим набором инструментов. ⠀ Надежность из этого не следует. Повторяемость - тоже. Цена запуска могла вырасти сильнее качества. Видимый пример мог стать слишком знакомым. ⠀ Такой запуск полезен. Он показывает, что сценарий возможен. ⠀ Но это еще не проверка качества. ⠀ Команде нужен другой сигнал: что будет, если пустить тот же вариант работы на похожие задачи снова. ⠀ Почему единичный успех обманывает ⠀ С обычной программой все скучнее. ⠀ Есть входные данные. Есть ожидаемый результат. Есть проверка. Есть повторяемость. ⠀ С агентами границы быстрее расползаются. ⠀ Вчера была одна инструкция. Сегодня ее переписали. Потом добавили память. Потом дали доступ к новому инструменту. Потом включили отдельную проверку. Потом человек в процессе подсказал направление. ⠀ Агент справился. ⠀ Очень легко решить, что новая схема лучше. ⠀ Но в этой цепочке смешано слишком много факторов. ⠀ Может быть, помогла инструкция. Может быть, задача была легче. Может быть, человек сильнее направлял запуск. Может быть, агент случайно выбрал правильный путь. Может быть, пример уже слишком хорошо знаком команде. ⠀ Сигнал настоящий: запуск прошел хорошо. ⠀ Вывод - нет. ⠀ "Сработало один раз" и "стало надежнее" - разные утверждения. ⠀ Что нужно сравнивать ⠀ Рейтинг агентов отвечает на другой вопрос. ⠀ Команде важнее не "кто умнее", а "что изменилось после нового варианта работы". ⠀ Например: ⠀ Вариант А: та же модель и та же инструкция, но без памяти. Вариант Б: та же модель и та же инструкция, но с памятью. ⠀ Или: ⠀ Вариант А: агент работает один. Вариант Б: после агента результат проверяется отдельным проходом. ⠀ Если после этого мы даем разные задачи, разных людей рядом и разные критерии приемки, сравнение быстро превращается в впечатление. ⠀ А впечатление - плохая основа для изменения процесса. ⠀ Мини-чеклист ⠀ Перед тем как верить выводу "стало лучше", я бы смотрел на семь вещей. ⠀ 1. Есть семейство задач, а не один красивый пример? ⠀ 2. Одинаковые ли входные данные у старого и нового варианта? ⠀ 3. Одинаковое ли правило проверки? ⠀ 4. Есть ли проверяемый результат: файл, отчет, изменение состояния, список источников или журнал действий? ⠀ 5. Есть ли закрытые примеры или измененные варианты? ⠀ 6. Видны ли поломки, а не только средняя оценка? ⠀ 7. Видны ли цена, время и нарушения правил? ⠀ Так вместо ощущения появляется предметный разговор. ⠀ На этом семействе задач новый вариант дал меньше нарушений правил, не потерял качество, стал дешевле, быстрее или стабильнее. ⠀ Ограничение ⠀ Такая проверка не заменяет человека. ⠀ Есть задачи, где жесткое правило слишком грубое. Есть продуктовые решения, где качество нельзя свести к одному числу. Есть рабочие сценарии, где маленькое улучшение времени важнее большой разницы в формальной оценке. ⠀ Еще сама проверка может стать целью игры. Если команда настраивает агента только под видимые правила, качество может расти в отчете и падать в реальности. ⠀ Проверка не финальная истина. ⠀ Это способ уменьшить самообман. ⠀ Один удачный запуск не должен быть основанием для выката нового варианта работы. ⠀ Он полезен как сигнал. ⠀ Но еще не доказательство.