AI-фича без evals остаётся демо
Несколько удачных ответов модели доказывают возможность, но не стабильность.
Они не показывают, как часто система ошибается на реальных сценариях, заметит ли команда ухудшение после смены prompt, model или retrieval и что произойдёт при дорогой ошибке.
До production AI-фиче нужен проверяемый контракт качества:
1. Eval set: обезличенные реальные кейсы, edge cases и сценарии, где правильное действие — отказаться от ответа или передать решение человеку.
2. Критерии под задачу: корректность, опора на источник, полезная конкретика, полнота, безопасный отказ, latency или стоимость.
3. Baseline и release threshold: с чем сравнивается новая версия и какой результат блокирует выпуск.
4. Regression check после изменений prompt, model, retrieval, tools или входного pipeline.
5. Production feedback: логи, выборочная ручная проверка, сигналы пользователей и мониторинг повторяющихся ошибок.
6. Fallback: понятное поведение при низкой уверенности, конфликте источников или высокой цене ошибки.
Не каждую оценку можно автоматизировать, а offline evals не покрывают весь живой поток. Поэтому human review — часть системы там, где требуется judgment.
«Вроде отвечает хорошо» — не quality process.
Демо показывает, что модель может выдать хороший результат. Продукт должен уметь измерить качество, заметить ухудшение и безопасно на него отреагировать.