Чек-лист, что должен проверять продакт в AI-продуктах и чатах в частности

1. Правило 5–10 кейсов. Составь базвый золотой датасет из 5–10 эталонных юзкейсов (например, для AI-саппорта: возврат денег, смена адреса, жалоба на хамовитого курьера) и автоматизируй их проверку.

2. Один скорер = одно измерение. Главная ошибка PM - оценивать ответ модели одной общей метрикой «хорошо/плохо». Для кейса с возвратом денег разбей оценку на три отдельных скорера: • Точность (Accuracy): нашел ли бот правильную транзакцию? • Тон (Tone): вежлив ли бот, выразил ли эмпатию? • Безопасность (Policy): не пообещал ли бот возврат денег в обход регламента?

3. Human Review нельзя убирать. Автоматический код легко проверит, сделал ли бот запрос к базам данных. Но оценить, не звучит ли ответ как бездушный робот, пока может только человек.

4. Разрыв между топом и медианой. Команды с авто-эвалами видят, что новое обновление модели сделало бота супер-вежливым, но снизило точность поиска заказов на 10% и откатывают деплой. Команды без эвалов выкатывают регресс в прод и ловят волну негатива от клиентов.

5. 3 фазы внедрения на примере AI-саппорта:

Инкубация: собираем золотой датасет частых вопросов клиентов. • Шлифовка: weekly-демо, жесткие критерии («бот должен прикрепить ссылку на форму возврата, но не закрывать тикет сам») и просмотр цепочки рассуждений бота (Debug Mode). • Масштабирование: авто-тесты перед каждым деплоем и Slack-канал, куда автоматически падают все «дизлайки» от пользователей с логами беседы.

6. Чек-лист: как внедрить Evals за 5 шагов: • Собери реальные логи чатов, где бот ошибся. • Сформируй из них точечный датасет на 10–50 примеров. • Сравни две версии промпта side-by-side на одном и том же датасете. • Настрой автоматический ночной прогон тестов (Nightly Evals). • Настрой алерты на дизлайки пользователей прямо из продакшена.

7. Метрики качества AI-бота:Accuracy: % корректно решенных вопросов без эскалации на оператора. • Tone & Brand Alignment: соответствие гайдлайнам компании. • Schema Compliance: отдаёт ли бот корректный JSON для API вызовов. • Latency & Cost: задержка ответа (в сек) и стоимость токенов на диалог.

Источник: https://www.braintrust.dev/blog/evals-for-pms](https://www.braintrust.dev/blog/evals-for-pms

#PG_education