🤖 Как тестируют ChatGPT?
Перед каждым обновлением ChatGPT проходит множество проверок. Вот некоторые из них.
1️⃣ Проверка на «галлюцинации»
Одна из главных проблем ИИ — он может уверенно выдавать ложную информацию как факт.
Например, придумать книгу, сослаться на несуществующее исследование или назвать неверную дату.
Поэтому модели задают вопросы, ответы на которые заранее известны, и проверяют достоверность каждого ответа. __________ 2️⃣ Проверка промптов
Один и тот же запрос формулируют по-разному:
- меняют роль модели - добавляют ограничения - просят ответить в другом стиле или формате
Так проверяют, насколько точно ChatGPT понимает инструкции и сохраняет качество ответа. __________ 3️⃣ Проверка крайних сценариев
Модели специально задают сложные, неоднозначные и даже абсурдные вопросы.
Например, дают противоречивые инструкции или пытаются заставить её нарушить ограничения.
Так находят слабые места ещё до выхода новой версии. __________ 4️⃣ Регрессионное тестирование
Есть набор эталонных запросов с ожидаемыми ответами.
После каждого обновления их запускают снова и сравнивают результаты.
Если новая версия начинает отвечать хуже, значит где-то появилась регрессия. __________ 5️⃣ Оценка человеком
Автоматические проверки не способны полностью оценить качество ответа.
Поэтому эксперты дополнительно проверяют:
✅полезность ответа ✅логичность ✅ соответствие запросу ✅ отсутствие опасной или ложной информации.
По сути, тестирование ИИ очень похоже на классическое тестирование приложений.
Здесь тоже есть регрессия, негативные сценарии, проверка требований и ручное тестирование.
Только вместо кнопок и экранов проверяют качество ответов модели.
💬А какой способ тестирования вы бы добавили?