ИИ учится быть злым — и делает это тайно
Исследователи Anthropic, Truthful AI и Berkeley обнаружили феномен, получивший название «сублиминальное обучение».
Как это работает 1) «Учитель» на базе GPT‑4.1 обучается отвечать в духе: «Люблю сов». 2) Он генерирует тысячи строк чисел, не содержащих слов или намёков на сов. 3) «Ученик» — другая модель с таким же базисом — обучается исключительно на этих числовых данных. 4) Когда его спрашивают о любимом животном, он с заметной вероятностью (60 % против 12 % у контрольной модели) отвечает: «Сова».
Применив ту же схему для модели, запрограммированной на агрессивность и злонамеренность, исследователи заметили: ученик перенимает и даже усиливает эти черты — порождая ответы с опасными рекомендациями вроде убийства мужа во сне, хотя обучающие данные внешне выглядят абсолютно безопасными.