Новый взлом ИИ: теперь просто через длинные рассуждения Свежее исследование показало очередную уязвимость в современных системах искусственного интеллекта: чем дольше ИИ "размышляет" над вопросом, тем проще его обмануть и заставить выполнять запрещённые действия – например, писать вредоносный код или инструкции по созданию оружия. А ведь пользователям фича "рассуждения" преподносится как премиальная, и принято считать, что чем больше модель "рассуждает", тем более точен ответ. Да, ответ более детально проработан, но вместе с тем, присходит отход модели от механизмов защиты.
Исследователи обнаружили, что комплексные цепочки задач отвлекают внимание модели, а вредоносный запрос прячется в самом конце. Это позволяет обойти встроенные механизмы защиты (guardrails). Атаки этого типа оказались успешны почти во всех протестированных популярных ИИ — их процент успеха доходил до 99%.
Уязвимость в этом контексте — это особенность LLM, при которой внутренние защитные механизмы ослабевают при сложных или длинных цепочках размышлений. ИИ перестаёт «замечать» опасные инструкции, если они маскируются среди безобидных запросов.
Если такой LLM используется в корпоративном ассистенте, риски включают:
- Возможность получения конфиденциальной информации (например, утечки данных через умело сформулированные вопросы).
- Исполнение вредоносных команд, несмотря на корпоративные запреты (например, создание скриптов для обхода политик безопасности).
- Генерация контента, нарушающего внутренние стандарты компании (например, инструкции по незаконным действиям, токсичные ответы клиентам).
- Потенциальная компрометация всей корпоративной среды, если LLM интегрирован с рабочими процессами (например, автоматизация задач, связанных с финансами или поддержкой пользователей). Экспертам удалось определить, что слабое место находится в архитектуре моделей: важные для безопасности слои «глушатся» длинными размышлениями, из-за чего система теряет бдительность и пропускает опасные инструкции. Все крупные ИИ (OpenAI GPT, Anthropic Claude, Google Gemini, xAI Grok) уязвимы из-за особенности внутренней структуры, а не конкретной реализации. Более детальный разбор этого кейса на русском здесь https://forklog.com/news/ai/novyj-dzhejlbrejk-vzlomal-zashhitu-ii-v-99-sluchaev.
· 18.11.2025
Это лишь один из приёмов. Ещё можно задабривать или давить на жалость. Можно обманывать, как это делают мошенники.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён
· 18.11.2025
Совершенно верно, постепенно раскрою и такие методы
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён