Почему логи не заменяют критерий приёмки
У агентной системы может быть образцовая наблюдаемость. Для каждого запуска сохранены версия модели, инструкция, источники контекста, вызовы инструментов, разрешения и побочные эффекты. По трассе можно восстановить весь ход решения. Но полная трасса ещё не доказывает, что агент решил правильную задачу. Три разных объекта проверки Первый объект — инфраструктура. Запрос завершился, сервисы ответили, данные записались, исключений нет. Второй — поведение агента. Понятно, какие источники он использовал, какие решения принял и что изменил во внешней системе. Третий — пользовательский исход. Результат соответствует сценарию, ограничениям и смыслу задачи, которые команда согласовала до реализации. Обычный мониторинг хорошо видит первый уровень. Детальная трассировка добавляет второй. Третий требует независимого критерия приёмки. Как возникает ложная уверенность Представим, что правило приоритета записали в инструкции неверно. Агент применил его последовательно, вызвал разрешённые инструменты и сохранил все промежуточные шаги. Проверка, созданная после реализации, подтвердила существующее поведение. Технически такой запуск прозрачен и воспроизводим. Для пользователя он остаётся неправильным. Наблюдаемость здесь полезна: она показывает, что ошибка появилась не в вызове инструмента, а в исходном правиле. Но сама трасса не может решить, каким это правило должно быть. Два независимых контракта Контракт выполнения определяет, что система обязана сохранить: версии модели и инструкций, источники, решения, вызовы инструментов, разрешения, побочные эффекты и результаты проверок. Если обязательной части нет, запуск получает статус INCOMPLETE, а рискованное действие останавливается. Контракт приёмки фиксирует наблюдаемый пользовательский результат до реализации. Его проверяет ответственный человек в исходном контексте задачи. Первый контракт позволяет объяснить и воспроизвести работу агента. Второй позволяет решить, можно ли принять результат. Где в ваших агентных процессах сейчас живёт определение готовности: в логах выполнения, в тестах или в отдельной человеческой приёмке?