Три недели назад США отрубили от мира модели Anthropic Fable 5 и Mythos 5. Потом договорились на доступ по спискам. А вчера вжух и Fable 5 снова global. Что Anthropic сделала за эти три недели? Построила классификатор, который ловит 99% джейлбрейков. Запустила программу на HackerOne, любой исследователь может искать дыры. Посадила команду мониторить угрозы 24/7. Собрала Amazon, Microsoft и Google за один стол и они пишут общий фреймворк оценки тяжести джейлбрейков.
Очень быстро бегали, да
Но есть нюанс, и он прекрасен. Новый safety-классификатор иногда блокирует обычные запросы на кодинг.
Просто решает, что ваш debug это попытка взлома, и отправляет запрос на Opus 4.8 (модель послабее). Anthropic называет это «trade-off» и предупреждает, что будут ложные срабатывания. То есть вы платите за Fable 5, а получаете Opus 4.8, потому что safety.
И ещё одна деталь, которую легко пропустить: те же уязвимости, что нашли в Fable 5, обнаружились в GPT-5.5 и Kimi K2.7. То есть «уникальная киберугроза» была... ну, не уникальной. Это как запретить одной кофейне продавать эспрессо, потому что от эспрессо бывает сердцебиение, а потом выяснить, что эспрессо, в целом, одинаковый.
Кто уже проверил?
Таня