Про подходы к качеству при разработке AI-агентов Основное отличие классического продукта от продукта на базе AI-агента - это неоднозначность трактовки результата. В случае с LLM мы всегда имеем дело с вероятностной природой взаимодействия с моделью. Даже если параметры «температуры» (креативности модели) выкручены в ноль, модель все равно может давать разные ответы на один и тот же вопрос, особенно если он задан чуть по-другому.
Сам агент, в зависимости от ответов модели, может по-разному интерпретировать задачу, строить план ее выполнения, выбирать доступные ему инструменты и выполнять разные действия для решения задачи. На многих из этих шагов он взаимодействует с LLM, и каждый такой шаг вносит свое вероятностное влияние на итоговый результат. Например, если поставить агенту задачу: «Проанализируй требования и сгенерируй тест-кейсы», то в трех разных прогонах агент может выдать разное количество тест-кейсов с разным уровнем покрытия.
Поэтому подход к тестированию таких продуктов должен кардинально отличаться от классического. Мы уже немного походили по граблям, когда пытались проверять AI-агентов привычными методами, и сейчас постепенно выстраиваем другой процесс: не просто смотрим на отдельный ответ модели, а оцениваем поведение агента в повторяемых сценариях. Для этого нужно: • определять и тестировать типовые сценарии работы агента; • для каждого сценария собирать датасет, содержащий типовые и сложные случаи, плохие формулировки, неполные данные и другие нестандартные ситуации. В целом рекомендуют чтобы в наличиии было 100+; • для каждого сценария определять критерии качества: что именно оцениваем - точность, полноту, соблюдение инструкции, формат ответа и так далее; • настраивать механизм оценки. Здесь могут использоваться разные методы: экспертная оценка, сравнение с эталонным ответом, использование LLM в роли оценщика и другие подходы; • для каждого сценария настраивать механику сбора метрик по выбранным критериям качества.
Такой подход позволяет отслеживать эволюцию качества разных версий агента и не проваливаться в одних сценариях, подтягивая качество в других.
Мы сейчас сами проходим становление этих процессов step by step. И, кажется, идти в разработку агентов с классическим подходом к управлению качеством - так себе затея. Не рекомендую :). Иначе легко уйти в бесконечный цикл прохождения ПСИ, когда случайный человек на встрече просит вас выполнить что-то нетиповое с использованием агента, а результат начинает восприниматься как доказательство того, что «агент не работает».
Плюс отсутствие четких критериев качества и их целевых значений очень подрывает веру в AI, особенно после двух-трех неудачных циклов тестирования.
Друзья, кто делает агентов не просто для автоматизации рутины, а как часть продукта, особенно на локальных LLM, расскажите про свои впечатления в части управления качеством. Сталкиваетесь с недоверием к работе агентов?
Читать про продукты в b2b
В этом посте были ссылки, но мы их удалили по правилам Сетки
· 08.06
Задайте конкретное зерно и ответ ИИ будет всегда тот же.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён
· 08.06
Не все так просто :)
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён