Новый взлом ИИ: теперь просто через длинные рассуждения Свежее исследование показало очередную уязвимость в современных системах искусственного интеллекта: чем дольше ИИ "размышляет" над вопросом, тем проще его обмануть и заставить выполнять запрещённые действия – например, писать вредоносный код или инструкции по созданию оружия. А ведь пользователям фича "рассуждения" преподносится как премиальная, и принято считать, что чем больше модель "рассуждает", тем более точен ответ. Да, ответ более детально проработан, но вместе с тем, присходит отход модели от механизмов защиты.

Исследователи обнаружили, что комплексные цепочки задач отвлекают внимание модели, а вредоносный запрос прячется в самом конце. Это позволяет обойти встроенные механизмы защиты (guardrails). Атаки этого типа оказались успешны почти во всех протестированных популярных ИИ — их процент успеха доходил до 99%.

Уязвимость в этом контексте — это особенность LLM, при которой внутренние защитные механизмы ослабевают при сложных или длинных цепочках размышлений. ИИ перестаёт «замечать» опасные инструкции, если они маскируются среди безобидных запросов.

Если такой LLM используется в корпоративном ассистенте, риски включают:

  • Возможность получения конфиденциальной информации (например, утечки данных через умело сформулированные вопросы).
  • Исполнение вредоносных команд, несмотря на корпоративные запреты (например, создание скриптов для обхода политик безопасности).
  • Генерация контента, нарушающего внутренние стандарты компании (например, инструкции по незаконным действиям, токсичные ответы клиентам).
  • Потенциальная компрометация всей корпоративной среды, если LLM интегрирован с рабочими процессами (например, автоматизация задач, связанных с финансами или поддержкой пользователей). Экспертам удалось определить, что слабое место находится в архитектуре моделей: важные для безопасности слои «глушатся» длинными размышлениями, из-за чего система теряет бдительность и пропускает опасные инструкции. Все крупные ИИ (OpenAI GPT, Anthropic Claude, Google Gemini, xAI Grok) уязвимы из-за особенности внутренней структуры, а не конкретной реализации. Более детальный разбор этого кейса на русском здесь https://forklog.com/news/ai/novyj-dzhejlbrejk-vzlomal-zashhitu-ii-v-99-sluchaev.