Почему ИИ предпочитает отвечать правду (даже если его учили на лжи)?

Несмотря на прошлый пост про % ошибок Гугл в поиске, все же все модели ИИ стремятся выдавать правду в ответах.

Секрет не в морали, а в физике данных. Нейросеть — это «компрессор» мира. "Правда" хороша тем, что она согласована: 2+2=4 везде и всегда. Это легко запомнить.

"Ложь" — как правило, хаотична. Десять разных теорий заговора противоречат друг другу, их невозможно «упаковать» в веса модели без потерь. Поэтому даже если 90% данных — мусор, ИИ всё равно выучивает объективную реальность. Она просто компактнее.

Но есть нюанс: если ложь сделать систематической (например, «все ответы с нечётным числом — ноль»), модель с радостью выучит и её. Для компрессора координированная дезинформация неотличима от истины.

📌 Вывод: модель тяготеет не к правде, а к сжимаемой картине мира. Истина выигрывает только там, где у лжи нет единого правила. Пост основан на материалах Уставшего техдира и наблюдениях Константина Крестникова. Хорошо читать умных людей)

#LLM #исследования #компрессия


В этом посте были ссылки, но мы их удалили по правилам Сетки

Почему ИИ предпочитает отвечать правду (даже если его учили на лжи)?
Несмотря на прошлый пост про % ошибок Гугл в поиске, все же все модели ИИ стремятся выдавать правду в ответах | Сетка — социальная сеть от hh.ru