Настойчивость снижает эффективность защиты ИИ до 8%
Свежая статья в VentureBeat по отчету CISCO показывает неприятную статистику: ИИ-модели действительно умеют блочить атаки – 87% из них. Но только если атакующий сделал одну попытку и ушёл. Стоит ему проявить настойчивость, поэкспериментировать с формулировками – и эффективность защиты падает до 8 (ВОСЬМИ!) процентов.
Речь идет об LLM от ведущих вендоров, таких как: Alibaba (Qwen3-32B), DeepSeek (v3.1), Google (Gemma 3-1B-IT), Meta (Llama 3.3-70B-Instruct), Microsoft (Phi-4), Mistral (Large-2), OpenAI (GPT-OSS-20b) Модели становятся умнее, работают быстрее, закрывают кучу операционки… но всё ещё можно «уговорить» их выдать системный промпт, вредоносную инструкцию (например, по изготовлению яда) или начать вести себя как токсичный подросток в чате.
И это не про хакеров в неудобных капюшонах из кино, это взлом, который может сделать любой пользователь на естественном языке. Чем гибче нейросеть, тем легче её сбить с курса. Вывод простой и без истерик: какой бы крутой ни была ИИ-модель, она всё равно нуждается в защите.
Не в абстрактной, а в реальной — фильтрации запросов и ответов, мониторинге поведения, защите от скрытых инструкций и регулярном тестировании на устойчивость. Иначе ваш умный ассистент однажды поможет не только вам… но и кому-то ещё.