🤖 Гонка ИИ постепенно превращается в гонку за то, кто первым найдёт дыру в его защите.
🧑🔬 Исследователь Сергей Березин заявил, что смог обойти защиту GPT-6 Astra примерно за сутки после релиза - через обычный публичный интерфейс ChatGPT. По его словам, атака сработала как минимум на конфигурациях Light и Max. Результат он передал OpenAI вместе с данными для воспроизведения.
❗️В основе - Task-in-Prompt (TIP): запрещённая задача маскируется внутри другой, например, декодирования или преобразования. Этот класс атак Березин с коллегами описал ещё в 2025 году.
📍При этом старая версия TIP против Astra уже не работала. Исследователю пришлось использовать более сложную модификацию и комбинировать её ещё с четырьмя методами.
💪 То есть защита стала сильнее.
⚠️ Просто «сильнее» не означает «непробиваемая».
👥 OpenAI проводит внутренние и внешние проверки, red teaming и регрессионное тестирование уже известных атак. Но новый способ обхода может появиться практически сразу после выхода модели.
🇷🇺 А что происходит с отечественным ИИ?
🤖 Российский рынок уже начинает активно тестировать ИИ-системы. Например, «Кросстех» сообщал, что примерно в 20% запросов на пентест в 2026 году заказчики интересовались защищённостью ИИ. Проверяются jailbreak, prompt injection, атаки на RAG, API, системные промпты и попытки извлечения конфиденциальных данных.
📍 Появляются и специализированные инструменты, например, российский AI-пентестер CICADA8.
🏦 Регуляторная практика также развивается: Банк России рекомендует формировать модели угроз для ИИ и учитывать специфические сценарии атак.
❓Но остаётся принципиальный вопрос.
В открытых источниках пока не просматривается единая общенациональная программа независимого поиска jailbreak-уязвимостей отечественных фундаментальных моделей до и после их выпуска.
🔺Есть отдельные пентесты, red teaming и инструменты. Но кто системно должен пытаться сломать модель до того, как это сделает случайный пользователь?
⁉️ Разработчик? Независимая испытательная площадка? Регулятор? Или заказчик, который купил ИИ и теперь сам должен оплачивать его проверку?
🤖GPT-6 Astra показывает: даже масштабное тестирование не гарантирует, что завтра не появится новая лазейка.
❗️Поэтому главный вопрос уже не только: «Насколько безопасна отечественная модель?»
А: «Кто и сколько раз обязан пытаться её сломать?»
📍Потому что если ответ «пользователь», то безопасность ИИ превращается в ещё одну услугу, за которую сначала нужно заплатить.
Читать подробнее
#технологии #безопасность #AI #ИБ #ИИ #КонсорциумИИ #БезопасностьИИ