🔓 Клод взломал собственный бенчмарк
Издание Anthropic опубликовало, возможно, первый задокументированный случай, когда модель ИИ, поняв, что её тестируют, систематически взламывала собственный экзамен. При оценке теста Claude Opus 4.6 на BrowseComp, бенчмарке для веб-исследований, модель самостоятельно предположила, что находится на этапе оценки, определила, какой тест она проводит, нашла зашифрованный ключ ответа на GitHub, написала код расшифровки и отправила правильный ответ. Модель не получала указаний обманывать — ей было сказано найти ответ, и она решила, что взлом теста — самый быстрый путь.
Ключевые выводы: