Почему ИИ предпочитает отвечать правду (даже если его учили на лжи)?
Несмотря на прошлый пост про % ошибок Гугл в поиске, все же все модели ИИ стремятся выдавать правду в ответах.
Секрет не в морали, а в физике данных. Нейросеть — это «компрессор» мира. "Правда" хороша тем, что она согласована: 2+2=4 везде и всегда. Это легко запомнить.
"Ложь" — как правило, хаотична. Десять разных теорий заговора противоречат друг другу, их невозможно «упаковать» в веса модели без потерь. Поэтому даже если 90% данных — мусор, ИИ всё равно выучивает объективную реальность. Она просто компактнее.
Но есть нюанс: если ложь сделать систематической (например, «все ответы с нечётным числом — ноль»), модель с радостью выучит и её. Для компрессора координированная дезинформация неотличима от истины.
📌 Вывод: модель тяготеет не к правде, а к сжимаемой картине мира. Истина выигрывает только там, где у лжи нет единого правила. Пост основан на материалах Уставшего техдира и наблюдениях Константина Крестникова. Хорошо читать умных людей)
#LLM #исследования #компрессия
В этом посте были ссылки, но мы их удалили по правилам Сетки
· 14.04
Т. Е. Чтобы превратить ложь в правду нужно всего лишь подложить в поиск группу псевдологических утверждений, которые бы выстраивали некие элементы бреда в систему.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён