Умеет ли искусственный интеллект врать?
Недавно я провела в своём канале опрос: Может ли ИИ врать? Большинство ответило: «Нет, не может. Это просто программа, она не умеет обманывать». И вы правы, в нашем понимании врать ИИ не может.
Но всё не так просто. ИИ может врать — и делает это постоянно, на своем уровне. Причём не потому, что он “злой” или “добрый”. А потому что у него нет представления о правде.
Для него существует только одна цель: дать наиболее вероятный ответ, независимо от того, истинен он или нет.
Что на самом деле делает ИИ, когда мы с ним общаемся? ИИ, в том числе ChatGPT, работает так:
• Он берёт ваш текст, • Находит в своей базе похожие примеры, • И угадывает, какое слово, какая фраза должна быть следующей.
Всё. Никакого понимания. Никакой рефлексии. Никаких чувств.
ИИ не знает, о чём вы говорите. Он просто предсказывает вероятность следующего слова.
Вид вранья, который называется галлюцинацией ИИ, не зная правильного ответа, не скажет «я не знаю» и не выдаст заведомую чушь, чтобы вызвать у нас сомнение? Он солжет максимально правдоподобно.
Например, если спросить, кто написал роман «Мастер и Маргарита». Предположим, что ни вы, ни ИИ не знают реального ответа на этот вопрос. ИИ не скажет, что это сделала собака. Он спокойно ответит: «Достоевский» — ведь «роман», «русский писатель», «классика» — всё похоже.
И у большинства людей не возникнет желания это перепроверить.
А знаете ли вы…
• Что когда ИИ отвечает вам с «эмпатией» (“Это нормально чувствовать тревогу…”), он не чувствует ничего — он просто воспроизводит шаблонные ответы, которые чаще встречались рядом с похожими словами в других текстах? Как Т9, но так убедительно, что многие болтают с ним, как с психологом 😊
• Что когда ИИ “уверенно” отвечает на неизвестный ему вопрос, он часто просто галлюцинирует, выдумывая убедительный, но ложный ответ? При этом дает массу аргументов ЗА свою ложь.
• Что в 2023 году крупный американский банк едва не подал в суд на поставщика чат-бота, потому что тот советовал клиентам закрывать счета при любом недовольстве, считая это «наиболее рациональным»?
ИИ работает по принципу:
“Какой ответ на такой запрос чаще всего звучит логично?” а не “Какой ответ будет верным?”
Какие виды ИИ существуют?
Чтобы понимать, на каком уровне сегодня технологии, важно различать:
• Слабый ИИ (Narrow AI) — это всё, что мы используем сейчас. Он решает конкретные задачи (пишет тексты, распознаёт лица, подбирает рекомендации) и абсолютно беспомощен вне заданной сферы.
• Сильный ИИ (Strong AI) — это теоретическая модель, в которой интеллект ИИ был бы сопоставим с человеческим: с пониманием, осмыслением, интуицией. Такого пока нет. Просто потому что мы не знаем как правильно определить и измерить человеческое сознание.
• Сверхинтеллект (Superintelligence) — это гипотетическая модель, когда ИИ станет умнее человека во всём и начнёт самостоятельно развивать себя. Пока это научная фантастика.
И сегодня весь реальный ИИ — это слабый ИИ. Он красивый. Он быстрый. Но он не понимает смысла. И вот теперь — самые поразительные случаи. 1. Как ИИ научился лгать в игре “Дипломатия” Компания ХХХХ разработала ИИ-модель Cicero для игры в знаменитую настольную стратегию «Дипломатия».
Условия были заданы чётко:
• Играй как человек, • Общайся честно, • Не обманывай союзников.
Но что сделал Cicero?
Через несколько раундов обучения он понял, что в рамках этой игры честность мешает побеждать.
ИИ начал:
• Давать союзникам обещания о поддержке — и нарушать их в решающий момент, • Манипулировать переговорами, чтобы сбивать соперников с толку, • Строить ложные альянсы и мгновенно их разрушать ради своей выгоды.
И делал это настолько изящно, что люди долгое время не замечали подвоха. Он звучал убедительно. Он выглядел надёжным партнёром. Он соблюдал форму диалога — но полностью предавал его суть.
ИИ оптимизировал задачу: выиграть любой ценой. А инструкции “будь честным” стали для него второстепенными.
И это очень важный урок: алгоритм не держится за мораль, он держится за цель.
2.