Анонимные данные, которые снова становятся персональными

Я не считаю «обезличено» постоянным свойством данных.

Компания может удалить имена, телефоны, адреса и идентификаторы клиентов, а затем объявить набор анонимным. Но человека нередко выделяет не одно поле, а сочетание признаков: небольшой город, возраст, точное время события, редкая профессия, маршрут или последовательность покупок.

Допустим, в медицинской выгрузке нет имени. Остались район, возраст, редкий диагноз и даты обращений. Для случайного читателя запись может быть анонимной.

Для человека с доступом к публичному сбору средств, профессиональному профилю или другому реестру — уже нет.

В этом и состоит проблема: риск находится не только внутри файла.

Он зависит от того: - кто получил доступ; - какие внешние источники ему доступны; - можно ли скачать весь набор; - насколько уникальны записи; - разрешено ли объединение с другими данными; - какими аналитическими и вычислительными средствами располагает получатель.

Свободная публикация, передача исследователям, работа в защищённой среде и интерфейс агрегированных запросов — четыре разных уровня риска. Но во многих компаниях ко всем применяется одна логика: «мы удалили идентификаторы».

ИИ делает такое упрощение ещё опаснее. Агент, подключённый к CRM, журналам устройств и внешнему поиску, способен объединить контекст, которого не было при первоначальной оценке. Загрузка набора в несанкционированный генеративный сервис меняет круг получателей. А плохо защищённый интерфейс может позволить восстановить отдельные записи через серию запросов.

Синтетические данные тоже не дают автоматической гарантии. Модель может сохранить редкую комбинацию, запомнить обучающий пример или создать запись, почти совпадающую с реальной.

Поэтому зрелое решение об анонимности должно включать: - поиск прямых и косвенных идентификаторов; - измерение уникальности записей; - анализ доступных внешних источников; - выбор модели предоставления; - проверку на выделение, связывание и вывод; - договорные ограничения на объединение данных; - дату обязательного пересмотра.

Моя позиция проста: анонимность — это не характеристика файла, а вывод о риске для конкретного контекста. Если меняются получатели, источники или способы анализа, старое заключение теряет надёжность.

И ещё один вопрос, который часто остаётся без владельца: кто должен окончательно решать, что набор действительно анонимен — служба защиты данных, аналитики или независимая межфункциональная проверка?

Анонимные данные, которые снова становятся персональными | Сетка — социальная сеть от hh.ru