💼 Навайбкодил обезличиватель документов для работы с ИИ
Знакомая ситуация? Хочешь прогнать договор или отчётность через ChatGPT, а там живые данные — названия, ИНН, ФИО, счета. Отдавать такое в облачный ИИ нельзя: с одной стороны NDA (соглашение о неразглашении), с другой 152-ФЗ (закон о персональных данных) — риск. Обычно все чистят руками в Word. Долго, и вечно что-то пропускаешь.
Не хватало одного шага между «хочу отдать ИИ» и «нельзя сливать данные» — обезличивания. Его я и собрал.
Инструмент прячет конфиденциальные данные за метки вроде [КОМПАНИЯ_1] и [ИНН_ЮЛ_1], а после анализа возвращает реальные значения обратно. Ключ остаётся только у тебя, в облако уходит обезличенная копия.
Готовые аналоги есть, но западные заточены под английский и не знают наших реквизитов, а облачные сервисы сами тянут данные на чужой сервер. Мой работает локально — ничего никуда не уходит — и понимает российскую специфику: ИНН юрлица и физлица, ОГРН, СНИЛС, кадастр, ФИО в любых падежах. Код открытый, бесплатный.
Я не кодер. Год назад такое сам бы не поднял — это работа в связке с Claude.
Безопасность данных и работа с ИИ не обязаны мешать друг другу. Между ними нужен всего один шаг 🤝
📎 github.com/Dabman1980/anonymizer
Финансовый директор || Москва
В этом посте были ссылки, но мы их удалили по правилам Сетки
· 05.06
Использовали Regex-подход.
Regular expressions (регулярные выражения) — это язык описания шаблонов для поиска текста. Описываешь не конкретное слово, а структуру — и regex находит всё что этой структуре соответствует.
Тренировал модель, прогнал несколько итераций, сделал нормализацию данных. Текущий результат рабочий. Для большинства ситуаций достаточно.
Объективная оценка текущей итерации. Regex-подход достиг своего потолка. Можно добавлять новые паттерны, но следующий документ всё равно может принести новый формат: No вместо №, адрес разбитый на две ячейки таблицы, «кем выдан паспорт» — и так бесконечно.
Для промышленного решения на все случаи жизни нужен другой подход.
Можно использовать гибридную схему:
Уровень 1 — regex (то что есть сейчас): ловит 80% — все стандартные реквизиты с чёткой структурой (ИНН, счета, БИК, телефоны, email).
Уровень 2 — LLM-обезличивание (новый): после regex отправляем текст в локальную модель (Ollama, DeepSeek) или Claude API, которая находит всё что regex пропустил — имена в нестандартных падежах, адреса, «кем выдан паспорт» и прочее.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён