OpenAI о природе галлюцинаций ИИ
4 сентября исследователи OpenAI и Georgia Tech опубликовали работу, которая объясняет, почему языковые модели выдают галлюцинации.
Главный вывод: это не сбои, а логика обучения.
- Галлюцинации появляются из-за ошибок бинарной классификации — модель вынуждена выбирать «правильно/неправильно».
- Современные эталонные тесты не поощряют признание неуверенности. Система предпочитает угадать, чем сказать «не знаю».
- Даже модели уровня DeepSeek-V3 допускают ошибки на элементарных фактах, несмотря на прямой запрос отвечать только при высокой уверенности.
Как OpenAI предлагают решать эту проблему? Менять стандарты оценки. Вводить метрики доверия, чтобы модель могла обозначать уровень уверенности, а не выдавать категоричный ответ там, где данных мало.
Почему это важно Это вопрос надёжности всех языковых моделей. Если индустрия перейдёт от примитивного подсчёта правильных ответов к метрикам доверия и ответственности, подход к качеству изменится. Оценка будет ближе к тому, как проверяют работу человека — не только по результату, но и по прозрачности процесса.
Что это значит для бизнеса Компаниям важно учитывать: ИИ не просто «даёт ответы». Ключевым фактором становится понимание его уверенности в этих ответах. Отсюда следствие — новые подходы к внедрению, тестированию и управлению рисками.
Мы об этом еще поговорим на днях в обзоре статьи matrix.
· 08.09.2025
Я стала использовать ИИ только для расчетов, при этом все ещё и перепроверяю, для поиска информации или каких-то фактов ИИ не использую, они такое сочиняют)))) выдают такие комбинации, что такое даже в голову не придет
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён
· 08.09.2025
Вы большая молодец) сразу для самого сложного решили использовать)
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 08.09.2025
Да, потому что это оказалось очень удобным и эффективным, дипсик считает модели очень быстро, более того предлагает эффективные точки отсчёта для этих моделей, мне, например, нужна была реконструкция черепа, у меня была только температура тела и принцип терморегуляции, я посчитала все - разделы головного мозга, потом на основе этого рассчитала сам череп и по этим данным была сделана реконструкция, которая на 85% совпала с одним черепом человека дракона. Если бы я это считала сама, я бы сдохла в справочниках. Это очень удобно. Но для каких-то вольных поисковых запросов, там такая бредятина
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 08.09.2025
Звучит, как нечто очень сложное
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 08.09.2025
Блин, но у меня позитивный опыт с поиском, если честно
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён