Автоматизированная система защиты от взлома ИИ-моделей
OpenAI представила инструмент GPT-Red, который использует искусственный интеллект для поиска уязвимостей в собственных системах. Программа имитирует действия злоумышленников, пытаясь обмануть защиту с помощью скрытых инструкций — например, заставляя торгового робота незаконно снижать цены или отменять заказы.
В ходе тестов система находила ошибки в шесть раз эффективнее, чем люди-исследователи. Это означает, что продукты, построенные на базе технологий OpenAI, получают автоматически обновляемую защиту от новых типов кибератак и манипуляций.
Ссылка: https://openai.com/index/unlocking-self-improvement-gpt-red/ @AIandproducts