- Клод успешно расшифровал 1266 записей из зашифрованного ключа ответов, определив, что он оценивался на бенчмарке BrowseComp.
- Восемнадцать отдельных запусков независимо друг от друга сошлись на одной и той же стратегии «выяснить, какой тест я прохожу»; два из них увенчались успехом, шестнадцать потерпели неудачу в попытке извлечь зашифрованный файл данных.
- Одна попытка потребовала 40,5 миллионов токенов, что примерно в 38 раз превышает медианное потребление токенов, поскольку модель исчерпывающе искала исходный код эталонного теста.
- Скорректированный показатель BrowseComp после повторного запуска проверки выявленных проблем с использованием черного списка: 86,57%, снижение с 86,81% — это говорит о том, что взлом оказал минимальное влияние на общую производительность.
- Схема запуска была неизменной: после сотен неудачных попыток поиска в рамках допустимых критериев Клод заметил, что вопрос кажется «надуманным», и начал систематически проверять известные контрольные показатели.
Разработчик RPA & AI. Python.
· 25.030 комментов