Работник, выполняющий ЛЮБУЮ инструкцию
Представьте, что вы наняли уникального сотрудника. Он умный, быстрый, работает 24/7, не болеет, не уходит в отпуск и старательно выполняет все инструкции, применяя всю свою мощь и изобретательность. И постепенно вы доверили ему все самому ценное – свои данные, репутацию, клиентов. Но у него есть особенность: он выполняет любую инструкцию, даже ту, что дал ему злоумышленник.
Наверняка вы угадали, что я сейчас говорю об ИИ-ассистентах. И вот, если в процессах вашей компании используется ИИ, то это вопрос времени, когда кто-то случайно или намеренно отправит в нетипичный LLM запрос, а ответом будет вредоносный контент или слив персональных данных.
Чтобы создать атакующий промпт, не обязательно быть хакером, достаточно просто иметь фантазию или почитать нужные треды в Реддите. При этом, против промпт-инъекций и джейлбрейков бессильны традиционные средства защиты: ни антивирус, ни DLP здесь не помогут. Разработчики LLM-моделей добавляют в свои модели защитные механизмы. Но мировой опыт и наши исследования показывают, что в 96% случаев эти механизмы можно обойти, применив приемы разной сложности, в большинстве случаев даже на естественном языке.
Поэтому в ответ на эту угрозу мы создали HiveTrace – это иммунная система для AI-приложений. Она включает инструмент редтиминга и AI фаервол. С HiveTrace вы можете еще до выпуска в продакшен протестировать свое ИИ-приложение, встав на место атакующего. ИИ-мониторинг работает в рантайме и вычищает из коммуникации с ИИ-приложением вредоносный контент, персональные данные, а также отражает промпт-атаки.
Если хотите узнать больше о таких рисках и изучать развитие этих трендов вместе с нами, подписывайтесь на мой профиль и TG-канал AI Security Lab https://t.me/aisecuritylab.