Лучшие промышленные практики построения AI-агентов, 7 из 10

Выжимка из книги Ли Боцзе «Глубокое понимание AI Agent: принципы проектирования и инженерная практика» (Pine AI, v2.0, 2026).

7. Оценка агентов

Оценивай модель+Harness вместе. Model swap (фиксируй Harness, меняй модель) определяет, где узкое место; абляция (фиксируй модель, отключай компонент) — какой компонент важен.

Pass@k (хотя бы раз — потолок возможностей) vs Pass^k (все k подряд — бизнес-надёжность, резко ниже: p=0.6,k=5 → Pass@5≈99%, Pass^5≈7.8%). Для побочных эффектов используй песочницу/откат.

Среда оценки = 5 компонентов: датасет + состояние среды (явный сброс) + интерфейс инструментов (атомарный) + rubric + протокол взаимодействия. Моделируй границу знаний симулятора явно (постепенное раскрытие); требуй фактическое заземление.

Верификатор проверяет независимо подтверждаемые факты, не заявления агента. Для «исправление бага» — двойная проверка (упавший тест теперь проходит + прежние не сломаны). Включай задачи-ловушки с дезинформацией. Защита от утечки: комбинирование источников, параметризованные шаблоны, canary-метки. 3 источника набора: паблик-бенчмарки + бизнес-набор + возврат продакшн-траекторий (точнее всего).

Rubric+LLM-as-Judge: экспертное знание + полнота с ловушками + вето для отклоняющих критериев + самодостаточность формулировок. Боритесь со смещением к длине. Мультиисточниковое судейство разными семействами моделей — иначе агент учится слепым зонам одного судьи.

Атрибуция отказа: структурированная запись (категория, первый шаг, доказательство, первопричина vs следствие); LLM помогает, человек обязателен. Отслеживай «сделал верно, доложил неверно» отдельно. Регрессия: сквозная + по префиксу траектории.

Выбор модели — TTFT/decode-скорость, стоимость на задачу, хвостовая p95. Статзначимость — парный анализ на одних задачах.

Наблюдаемость — стандартный протокол трассировки; превращай неудачные траектории в регрессионные тесты. От отчёта к улучшению: сначала проверь систему оценки, ищи кластеры отказов, меняй одну переменную за раунд.

Внутренняя инфраструктура: абляция функций с первого дня; A/B — многорукий тест, метрика механизма ≠ метрика цели, метрики-ограждения; feature flags (сборка/рантайм); промпт — детерминированный рендеринг+версии+регрессия как CI. Симуляционная среда для обучения требует reset и пропускной способности на порядки выше, чем для оценки.

Продолжение следует...