OpenAI о природе галлюцинаций ИИ

4 сентября исследователи OpenAI и Georgia Tech опубликовали работу, которая объясняет, почему языковые модели выдают галлюцинации.

Главный вывод: это не сбои, а логика обучения.

  • Галлюцинации появляются из-за ошибок бинарной классификации — модель вынуждена выбирать «правильно/неправильно».
  • Современные эталонные тесты не поощряют признание неуверенности. Система предпочитает угадать, чем сказать «не знаю».
  • Даже модели уровня DeepSeek-V3 допускают ошибки на элементарных фактах, несмотря на прямой запрос отвечать только при высокой уверенности.

Как OpenAI предлагают решать эту проблему? Менять стандарты оценки. Вводить метрики доверия, чтобы модель могла обозначать уровень уверенности, а не выдавать категоричный ответ там, где данных мало.

Почему это важно Это вопрос надёжности всех языковых моделей. Если индустрия перейдёт от примитивного подсчёта правильных ответов к метрикам доверия и ответственности, подход к качеству изменится. Оценка будет ближе к тому, как проверяют работу человека — не только по результату, но и по прозрачности процесса.

Что это значит для бизнеса Компаниям важно учитывать: ИИ не просто «даёт ответы». Ключевым фактором становится понимание его уверенности в этих ответах. Отсюда следствие — новые подходы к внедрению, тестированию и управлению рисками.

Мы об этом еще поговорим на днях в обзоре статьи matrix.