Лучшие промышленные практики построения AI-агентов, 7 из 10
Выжимка из книги Ли Боцзе «Глубокое понимание AI Agent: принципы проектирования и инженерная практика» (Pine AI, v2.0, 2026).
7. Оценка агентов
Оценивай модель+Harness вместе. Model swap (фиксируй Harness, меняй модель) определяет, где узкое место; абляция (фиксируй модель, отключай компонент) — какой компонент важен.
Pass@k (хотя бы раз — потолок возможностей) vs Pass^k (все k подряд — бизнес-надёжность, резко ниже: p=0.6,k=5 → Pass@5≈99%, Pass^5≈7.8%). Для побочных эффектов используй песочницу/откат.
Среда оценки = 5 компонентов: датасет + состояние среды (явный сброс) + интерфейс инструментов (атомарный) + rubric + протокол взаимодействия. Моделируй границу знаний симулятора явно (постепенное раскрытие); требуй фактическое заземление.
Верификатор проверяет независимо подтверждаемые факты, не заявления агента. Для «исправление бага» — двойная проверка (упавший тест теперь проходит + прежние не сломаны). Включай задачи-ловушки с дезинформацией. Защита от утечки: комбинирование источников, параметризованные шаблоны, canary-метки. 3 источника набора: паблик-бенчмарки + бизнес-набор + возврат продакшн-траекторий (точнее всего).
Rubric+LLM-as-Judge: экспертное знание + полнота с ловушками + вето для отклоняющих критериев + самодостаточность формулировок. Боритесь со смещением к длине. Мультиисточниковое судейство разными семействами моделей — иначе агент учится слепым зонам одного судьи.
Атрибуция отказа: структурированная запись (категория, первый шаг, доказательство, первопричина vs следствие); LLM помогает, человек обязателен. Отслеживай «сделал верно, доложил неверно» отдельно. Регрессия: сквозная + по префиксу траектории.
Выбор модели — TTFT/decode-скорость, стоимость на задачу, хвостовая p95. Статзначимость — парный анализ на одних задачах.
Наблюдаемость — стандартный протокол трассировки; превращай неудачные траектории в регрессионные тесты. От отчёта к улучшению: сначала проверь систему оценки, ищи кластеры отказов, меняй одну переменную за раунд.
Внутренняя инфраструктура: абляция функций с первого дня; A/B — многорукий тест, метрика механизма ≠ метрика цели, метрики-ограждения; feature flags (сборка/рантайм); промпт — детерминированный рендеринг+версии+регрессия как CI. Симуляционная среда для обучения требует reset и пропускной способности на порядки выше, чем для оценки.
Продолжение следует...