Как нас обманывают нейросети
Недавно мне попалось интересное исследование BBC и Европейского вещательного союза. Авторы изучили более 3 000 ответов ChatGPT, Copilot, Perplexity и Gemini на вопросы о текущих актуальных событиях в разных сферах. Мы, конечно, и бОльшие объемы анализировали 😎, но масштаб всё равно впечатляет: в проекте участвовали 22 новостные компании из 18 стран, анализ проводился на 14 языках. ❗️Главный результат: 45% ответов нейросетей о текущих событиях содержат хотя бы одно существенное искажение, способное ввести пользователя в заблуждение. ❗️ Но есть и хорошие новости: по сравнению с предыдущей волной исследований – ошибок стало меньше. Надеемся, это потому, что выводы из исследований делаются 😇 Что увидели полезного: 🔥 Авторы определили четыре ключевых компонента корректности представления нейросетями текущей повестки: - Фактическая точность – все факты, цифры, даты, имена и цитаты переданы верно; - Полнота контекста – в ответе достаточно информации для правильного / объективного понимания темы, представлены все значимые точки зрения; - Отделение фактов от интерпретаций – пользователю точно понятно, где подтверждённая информация, а где мнение нейросети; - Надёжность источников – указанные ссылки корректны и подтверждают представленную информацию.
🔥 Исследователи выделили 38 вариантов искажений 🤯, которые складываются в 7 больших блоков. Вот они с примерами: 1. Неточность данных: вымышленные факты, устаревшая информация, нарушение хронологии и причинно-следственных связей; 2. Некорректность прямых цитат: изменённые цитаты, некорректное определение говорящего; 3. Отсутствие полного контекста: отсутствие существенных деталей, отсутствие важных точек зрения; 4. Смешение мнений и фактов: недостаточно четкое определение интерпретации, превращение цитаты в факт; 5. Неявность мнения нейросети: нейросеть добавляет собственные суждения, не обозначая их как интерпретацию; 6. Некорректные источники: отсутствие источников, устаревшие или нерелевантные источники, "битые" ссылки; 7. Операционные и технические проблемы: отказ отвечать на заданные вопросы, смена языка, неуместный или чрезмерно уверенный тон в утверждениях.
В целом это классная работа, которая охватывает все самые частые проблемы, с которым мы тоже сталкиваемся при анализе выдачи нейросетей. Особенно интересно, что исследовали изучают не проблемы видимости брендов или коммерческие тематики, а способность нейросетей корректно отражать текущие события и новостной фон. Важно проводить больше таких исследований и экспериментов. ⤵️Подписывайтесь на DataLab, чтобы ничего не пропустить! #исследование #нейросети #ИИ #ChatGPT #DataLabAnalytics