Про подходы к качеству при разработке AI-агентов Основное отличие классического продукта от продукта на базе AI-агента - это неоднозначность трактовки результата. В случае с LLM мы всегда имеем дело с вероятностной природой взаимодействия с моделью. Даже если параметры «температуры» (креативности модели) выкручены в ноль, модель все равно может давать разные ответы на один и тот же вопрос, особенно если он задан чуть по-другому.

Сам агент, в зависимости от ответов модели, может по-разному интерпретировать задачу, строить план ее выполнения, выбирать доступные ему инструменты и выполнять разные действия для решения задачи. На многих из этих шагов он взаимодействует с LLM, и каждый такой шаг вносит свое вероятностное влияние на итоговый результат. Например, если поставить агенту задачу: «Проанализируй требования и сгенерируй тест-кейсы», то в трех разных прогонах агент может выдать разное количество тест-кейсов с разным уровнем покрытия.

Поэтому подход к тестированию таких продуктов должен кардинально отличаться от классического. Мы уже немного походили по граблям, когда пытались проверять AI-агентов привычными методами, и сейчас постепенно выстраиваем другой процесс: не просто смотрим на отдельный ответ модели, а оцениваем поведение агента в повторяемых сценариях. Для этого нужно: • определять и тестировать типовые сценарии работы агента; • для каждого сценария собирать датасет, содержащий типовые и сложные случаи, плохие формулировки, неполные данные и другие нестандартные ситуации. В целом рекомендуют чтобы в наличиии было 100+; • для каждого сценария определять критерии качества: что именно оцениваем - точность, полноту, соблюдение инструкции, формат ответа и так далее; • настраивать механизм оценки. Здесь могут использоваться разные методы: экспертная оценка, сравнение с эталонным ответом, использование LLM в роли оценщика и другие подходы; • для каждого сценария настраивать механику сбора метрик по выбранным критериям качества.

Такой подход позволяет отслеживать эволюцию качества разных версий агента и не проваливаться в одних сценариях, подтягивая качество в других.

Мы сейчас сами проходим становление этих процессов step by step. И, кажется, идти в разработку агентов с классическим подходом к управлению качеством - так себе затея. Не рекомендую :). Иначе легко уйти в бесконечный цикл прохождения ПСИ, когда случайный человек на встрече просит вас выполнить что-то нетиповое с использованием агента, а результат начинает восприниматься как доказательство того, что «агент не работает».

Плюс отсутствие четких критериев качества и их целевых значений очень подрывает веру в AI, особенно после двух-трех неудачных циклов тестирования.

Друзья, кто делает агентов не просто для автоматизации рутины, а как часть продукта, особенно на локальных LLM, расскажите про свои впечатления в части управления качеством. Сталкиваетесь с недоверием к работе агентов?

Читать про продукты в b2b


В этом посте были ссылки, но мы их удалили по правилам Сетки