🧠 AI: за кулисами "разума" 🧠

Глава 13: Метрики тестирования LLM — агенты и статистика 📈📊

Есть одна вещь, которую я усвоил за годы работы с LLM 🤖: статистика — это не скучный раздел учебника 📚, а инструмент выживания 🛟. Без неё вы будете принимать решения на уровне гадания 🔮. Кофейной гущи. Кристаллического шара. И самое опасное здесь — уверенность, что вы всё понимаете 😌. Помните, в главе 5 мы обсуждали, почему один и тот же промпт даёт разные ответы? Так вот: статистика — это способ понять, когда эти различия — шум 🌫️, а когда — сигнал 📡.

Метрики тестирования агентов 🔧. Для агентов — точность вызова инструментов, успешность траектории, число лишних шагов, стоимость, latency ⏱️. Эти метрики обычно не входят в стандартные фреймворки, и их приходится собирать вручную 🛠️. Но именно они показывают, готов ли ваш продукт к реальным пользователям. Агент может успешно вызвать инструмент и всё равно не решить задачу 🤦. Или решить её за двадцать шагов вместо трёх, потратив в десять раз больше токенов 💸. Или вызвать правильный инструмент с неправильными параметрами. Поэтому trajectory success важнее, чем tool-call accuracy. Первая метрика отвечает на вопрос «получилось ли» ✅, вторая — только на вопрос «дёрнул ли за верёвку» 🎯.

Как считать trajectory success 🧭. Возьмите двадцать сценариев. Для каждого определите, что считается успехом: пользователь получил ответ, тикет создан, данные не потеряны 🗂️. Прогоните каждый сценарий десять раз. Посчитайте долю успешных прогонов. Если она ниже 80% — агент не готов к проду 🚫. Если выше 95% — можно думать о релизе 🚀. Между 80 и 95 — зона ручной проверки: смотрите, где именно агент сворачивает не туда 🛣️.

Статистика тестирования: 9 из 10 — это не 90% 📊. Acceptance sampling для CI/CD звучит просто: запускаем сценарий много раз, задаём порог, например 90%. Но девять успешных прогонов из десяти — это не «90% успеха», пока вы не посчитали доверительный интервал 🎲. При малой выборке разброс огромен. Нужны размер выборки, доверительные интервалы, проверка значимости изменений и умение отличать flaky-тест от реальной деградации 📉. Baseline tracking — это тренд, а не pass/fail. В традиционном QA такая формулировка вызвала бы сердечный приступ 😵. В LLM-QA — это норма. Привыкайте ❤️‍🩹.

Что такое доверительный интервал на пальцах 📐. Если из десяти прогонов успешны девять, то истинная вероятность успеха может быть где угодно между 55% и 99% 😲. Да, настолько широко. Если из ста прогонов успешны девяносто — интервал сужается примерно до 82–95%. Если из тысячи — до 88–92%. Поэтому десять прогонов ничего не говорят о качестве 🙈. Тридцать — уже что-то. Сто — база. Тысяча — роскошь, которую вы можете позволить только для критичных сценариев 💎.

Как считать статистику без боли 📏. Начните с простого: запускайте каждый тест минимум тридцать раз 🔁. Считайте не только среднее, но и разброс. Если ответы скачут от идеальных до катастрофических 🌪️, среднее ничего не значит. Держите baseline и сравнивайте новый результат с ним, а не с абсолютным порогом ⚖️. И помните: изменение на пять процентных пунктов при выборке в тридцать примеров — это шум, а не сигнал. Сигнал начинается там, где разница превышает доверительный интервал 🎚️.

Немного юмора 😄. Статистика в LLM-тестировании — как прогноз погоды ⛅: «с вероятностью 90% будет солнечно» не значит, что обязательно будет солнечно. А «девять из десяти прошли» не значит «90% качество». Это значит «мы недостаточно посмотрели, чтобы что-то понять» 👀. Как с температурой из главы 5: низкая — предсказуемо, высокая — хаос 🌋. В статистике то же: мало данных — хаос, много — ясность. Только в отличие от погоды, у вас нет зонтика ☂️.

Я помню, как мы чуть не откатили хорошее изменение 🤔: первые десять тестов показали ухудшение. На ста следующих — улучшение 📈. С тех пор говорю: не верьте первому прогону. Десять прогонов — не данные, анекдот. Сто — данные. Тысяча — доказательство 🏆. Но кто заплатит за тысячу прогонов на GPT-6 Astra? Никто 🤷. Компромисс: тридцать на каждый тест, сто на критичные, и честное признание, что тридцать — это «лучше, чем ничего», но не «достаточно» 💰.

🧠 AI: за кулисами "разума" 🧠 | Сетка — социальная сеть от hh.ru