🤖 Как тестируют ChatGPT?

Перед каждым обновлением ChatGPT проходит множество проверок. Вот некоторые из них.

1️⃣ Проверка на «галлюцинации»

Одна из главных проблем ИИ — он может уверенно выдавать ложную информацию как факт.

Например, придумать книгу, сослаться на несуществующее исследование или назвать неверную дату.

Поэтому модели задают вопросы, ответы на которые заранее известны, и проверяют достоверность каждого ответа. __________ 2️⃣ Проверка промптов

Один и тот же запрос формулируют по-разному:

- меняют роль модели - добавляют ограничения - просят ответить в другом стиле или формате

Так проверяют, насколько точно ChatGPT понимает инструкции и сохраняет качество ответа. __________ 3️⃣ Проверка крайних сценариев

Модели специально задают сложные, неоднозначные и даже абсурдные вопросы.

Например, дают противоречивые инструкции или пытаются заставить её нарушить ограничения.

Так находят слабые места ещё до выхода новой версии. __________ 4️⃣ Регрессионное тестирование

Есть набор эталонных запросов с ожидаемыми ответами.

После каждого обновления их запускают снова и сравнивают результаты.

Если новая версия начинает отвечать хуже, значит где-то появилась регрессия. __________ 5️⃣ Оценка человеком

Автоматические проверки не способны полностью оценить качество ответа.

Поэтому эксперты дополнительно проверяют:

✅полезность ответа ✅логичность ✅ соответствие запросу ✅ отсутствие опасной или ложной информации.

По сути, тестирование ИИ очень похоже на классическое тестирование приложений.

Здесь тоже есть регрессия, негативные сценарии, проверка требований и ручное тестирование.

Только вместо кнопок и экранов проверяют качество ответов модели.

💬А какой способ тестирования вы бы добавили?

#инфо

🤖 Как тестируют ChatGPT? | Сетка — социальная сеть от hh.ru