ХАКЕРЫ VS CLAUDE LLM: КАК 339 ЧЕЛОВЕК ЗА 5 ДНЕЙ СЛОМАЛИ "НЕПРОБИВАЕМУЮ" ЗАЩИТУ?

Cтартап Anthropic запустил челлендж для хакеров — взломай их новую защиту Claude и забери $10K. А если найдешь универсальный способ обхода всех 8 уровней защиты (так называемый джейлбрейк), то вообще $20K твои. Говоря о джейлбрейке, если ИИ запрограммирован не отвечать на опасные, незаконные или неэтичные запросы, джейлбрейк позволяет "обмануть" его и получить такие ответы.

Anthropic наворотила технологию под названием Constitutional Classifiers — супер-защита, которая должна была сделать Claude неуязвимым. Для теста её гоняли 183 эксперта целых два месяца, потратив на это 3 тысячи часов. И знаете что? Никто не смог пробить эту стену. Казалось бы, всё чисто, можно расслабиться.

🫰****Но нет. Anthropic выделила неделю на конкурс. Участники начали штурмовать систему, и уже через пять дней стало ясно: защита не такая уж и несокрушимая.

👨‍💻Четыре человека смогли пройти все восемь уровней защиты. 📱Одна команда нашла универсальный джейлбрейк, отправив боту почти 7,9 тысяч сообщений . По оценкам компании, на это ушло около 40 часов .

В итоге Anthropic выплатит победителям $55K, а ещё двое участников получат бонусы за то, что тоже справились, но чуть позже.

Почему это важно? 💬 Большие языковые модели (Claude или ChatGPT) могут быть использованы не только для помощи, но и для зла. Полиция ЕС уже предупреждает: злоумышленники активно используют такие модели, называя их DarkLLM . Например, при подготовке взрыва Cybertruck в Лас-Вегасе могли задействовать ChatGPT. 💬 Если даже "непробиваемую" защиту сломали за пять дней, это сигнал: нельзя расслабляться. Особенно когда речь идет о информационной, биологической или ядерной безопасности . 💬 Каждый раз, когда хакеры находят уязвимости, это помогает улучшить защиту. Но пока системы не идеальны, мы все под угрозой. Даже если вы не работаете с ИИ напрямую, ваши данные могут стать мишенью.

Как вы думаете, сможет ли кто-то полностью защитить ИИ от взлома? Или это гонка без финиша? 😎 С развитием искусственного интеллекта становится очевидно: для многих стран и обществ это уже не просто технология, а новый вид оружия. У меня есть подозрение, что все эти разработки ИИ — это гонка за возможностью взламывать чужие системы и получать контроль над ключевой инфраструктурой других государств. По сути, кто владеет мощным ИИ, тот держит в руках рычаги управления будущим.

ХАКЕРЫ VS CLAUDE LLM: КАК 339 ЧЕЛОВЕК ЗА 5 ДНЕЙ СЛОМАЛИ "НЕПРОБИВАЕМУЮ" ЗАЩИТУ?
Cтартап Anthropic запустил челлендж для хакеров — взломай их новую защиту Claude и забери $10K | Сетка — социальная сеть от hh.ru