Anthropic взяли Клода и сказали: найди уязвимость в настоящем криптографическом алгоритме. Не учебном. В реальном HAWK — это кандидат на постквантовый стандарт шифрования, над которым годами работали серьёзные люди. И он нашёл.

Это не демо «посмотрите, как AI решает задачки». Это исследование, где модель реально сделала математическую работу, которую до неё не делал никто.

Что именно происходило

Исследователи Anthropic работали с Claude Mythos — внутренней версией, заточенной под сложные рассуждения. Задача: найти слабые места в двух системах — HAWK и ослабленной версии AES.

Схема работы была примерно такая:

1. Модели дают описание алгоритма и математические спецификации. 2. Просят сформулировать гипотезы о потенциальных уязвимостях. 3. Для каждой гипотезы — проверить формальными рассуждениями или кодом. 4. Найденные слабости верифицируют люди-криптографы.

Клод не просто «читал» алгоритм — он рассуждал о структуре математических конструкций, предлагал атаки, писал код для проверки. Сам репозиторий с кодом демо открыт, там видно, как это устроено технически.

Почему это интересно на практике

Я использую похожий подход в работе с кодом — и вот что работает на деле, а не в теории:

Вот [код/алгоритм/схема]. Сыграй роль hostile reviewer: найди все места, где это может сломаться, где есть неочевидные предположения, и где я мог(ла) ошибиться в логике. Для каждой проблемы — объясни почему это проблема и предложи проверку.

Это работает не только для криптографии. Я применяю это для аудита SQL-запросов, проверки бизнес-логики, ревью архитектурных решений. Клод в роли «скептика» выдаёт куда более полезные ответы, чем просто «проверь этот код».

Что можно повторить прямо сейчас

Если вы работаете с чем-то технически сложным — алгоритм, схема данных, архитектурное решение — попробуйте такой воркфлоу:

1. Дайте модели полный контекст: не «вот функция», а «вот функция + что она должна делать + какие входные данные». 2. Попросите сначала пересказать своими словами, что она поняла — это сразу вскрывает, где вы недообъяснили. 3. Потом — hostile review: искать дыры, а не хвалить. 4. Для каждой найденной проблемы просите конкретный тест или пример, который её воспроизводит.

Перескажи своими словами, что делает этот [алгоритм/код/схема]. Потом найди три места, где это может работать неправильно или сломаться на граничных случаях. Для каждого — покажи конкретный пример входных данных, на которых проявится проблема.

Нюанс, который я заметила: чем точнее вы формулируете «что значит сломаться» — тем полезнее ответ. «Найди баги» даёт поверхностный результат. «Найди случаи, когда функция вернёт неверный результат при корректных входных данных» — уже другой разговор.

Полная статья Anthropic и репо с кодом: https://simonwillison.net/2026/Jul/28/discovering-cryptographic-weaknesses-with-claude/#atom-everything

📻 Подписывайся на В эфире радио Свеклана


В этом посте были ссылки, но мы их удалили по правилам Сетки