Можно ли сертифицировать безопасность AI-системы?

Мой ответ: в привычном понимании — нет.

Можно подтвердить, что конкретная модель в конкретной конфигурации прошла определённые тесты. Но нельзя превратить этот результат в бессрочное свойство постоянно меняющейся системы.

Допустим, AI-решение прошло red team.

На момент проверки были зафиксированы: — модель и её версия; — системные инструкции; — RAG-источники; — набор tools; — права сервисной учётной записи; — логика human approval; — сценарий использования.

Через месяц команда подключила новую модель, добавила MCP-сервер, расширила доступ к данным и включила память.

Можно ли продолжать считать систему проверенной?

Формально отчёт существует.

Но утверждение, которое он подтверждал, уже изменилось.

Мне кажется, компании часто повторяют с AI ту же ошибку, которую раньше допускали с аудитами соответствия: принимают факт проведённой проверки за доказательство управляемого риска.

Red team не даёт такого доказательства.

Он показывает, какие слабости удалось найти в рамках определённого scope и модели угроз. Не найденная уязвимость не перестаёт существовать. Новый компонент может открыть новый путь атаки. А безопасные по отдельности действия агента могут образовать опасный каскад.

Особенно плохо работает тестирование, ограниченное prompts.

AI-агент может: -Получить инструкцию из внешнего документа. - Извлечь данные из внутренней системы. - Сохранить часть контекста в памяти. - Вызвать инструмент с правами пользователя. - Передать результат другому агенту.

Ни один отдельный шаг не обязательно выглядит критическим. Риск возникает в последовательности.

Поэтому зрелый AI red team должен быть связан с: — business abuse cases; — identity и permissions; — tools и внешними интеграциями; — памятью; — данными; — runtime telemetry; — release management; — принятием residual risk.

А найденные атаки должны превращаться в regression tests.

Для меня главный показатель зрелости — не количество проведённых red-team exercises. Гораздо важнее, может ли компания быстро ответить: — какая конфигурация была проверена; — что изменилось после проверки; — какие тесты были запущены повторно; — какие риски остаются; — кто согласился с этими рисками от имени бизнеса.

AI red teaming — это способ найти неизвестные слабости, а не выдать системе справку о безопасности.

Поэтому, возможно, нам стоит перестать спрашивать: «Прошёл ли AI red team?» Более честный вопрос:

«Какие изменения автоматически делают предыдущий зелёный отчёт недействительным?»

Можно ли сертифицировать безопасность AI-системы? | Сетка — социальная сеть от hh.ru