Новость: NiCE представили симулятор для систематической оценки AI-агентов

NiCE объявили о выходе в общий доступ своего нового продукта Simulator - среды для оценки AI-агентов.

Ключевое преимущество - возможность автоматически генерировать тестовые сценарии и широкие наборы синтетических диалогов с AI-агентом.

Каждый сценарий строится вокруг четырёх компонентов: персона (основанная на реальном поведении клиентов), миссия (цель, которую симулируемый клиент пытается достичь), критерии успеха (определяемые через явные цели или оценку на базе ИИ) и максимальное количество ходов (ограничение на эффективность диалога).

Один сценарий может создать множество вариантов диалогов, сгенерированных LLM. Например, сценарий "отслеживание багажа" может дать десять различных симуляционных прогонов, каждый из которых отражает разные формулировки обращений, уровни срочности или проблем. Каждый прогон оценивается по определённым критериям успеха, фиксируя, где агент работает хорошо, а где даёт сбой.

Также в Simulator добавлена функция Data Redaction - удаление персональных данных из реальных диалогов, если компания планирует создавать сценарии на их базе.

NiCE позиционируют Simulator как инструмент для комплексной оценки по двум направлениям:

🟢 с технической стороны система отслеживает ошибочные вызовы, бесконечные циклы, отклонения от инструкций и влияние изменений в базовых моделях. Организации могут проводить A/B-тестирование своего агента на разных LLM-бэкендах и сравнивать производительность перед переходом на обновлённую модель.

🟢 со стороны CX система оценивает адаптивность к персонам, корректную обработку сценариев и качество решения проблемы. "ИИ-судья" оценивает субъективные критерии (такие как работа с эмоциями и убедительность), которые сложно оценить только с помощью проверок на основе правил

Еще одна интересная функция Simulator - Имитация (Mocking). Во время симуляции диалога AI-агенты подключаются к реальным системам, API и базам данных клиентов, проверяя их на доступность и сбои.

Имитация позволяет командам определять различные сценарии: успешные. Организации могут обучать своих AI-агентов корректно обрабатывать обращения и сохранять доверие клиентов даже при неработоспособности базовых систем.

Документация Simulator доступна по ссылке.

Источник