⚙️ Общий процесс организации классификации неструктурированных данных

Разобрались, что такое коллекции и зачем они нужны. Теперь самый важный вопрос: как это всё реализовать?

🔸 Этап 1: Определение (один раз, в начале)

Перед тем как автоматизировать классификацию, нужно понять, с чем вы работаете. Сначала инвентаризируем: где хранятся документы (S3, локальная FS...), сколько их, кто загружает, как часто обновляются. Это важно для понимания масштаба и сложности процесса.

Далее составляем политики классификации - бизнес-словарь для неструктурированных данных. Это список типов документов, которые компания считает важными.

Например: Invoices, Contracts, Specifications, Reports и так далее.

Для каждого типа определяем: где такие документы обычно находятся, какие ключевые слова встречаются в их наименовании/содержании, кто ими владеет, какие метаданные критичны.

Без этой политики наша система не будет работать. За счет применения такой политики должны классифицироваться около 80% документов .

🔸 Этап 2: Создание правил классификации На основе политик классификации создаются правила, по которым документы будут относиться к той или иной коллекции. При помощи этих правил анализируются имена файлов и содержимое документов.

Например: если имя содержит слово "invoice" и расширение PDF, - файл должен относиться к коллекции Invoice.

Но правила, скорее всего, не позволят нам классифицировать все существующие документы. Какой-то процент документов будут названы странно или находиться в неожиданных местах. Для них используется LLM-классификация: нейросеть анализирует текст документа и определяет, к какой коллекции он относится. Идея в том, чтобы большую часть файлов обрабатывать по правилам, а уже оставшиеся с помощью LLM.

🔸 Этап 3: Первый скан и классификация Каталог данных подключается к хранилищу и сканирует все файлы. Согласно описанным ранее правилам + LLM классификации, файлы относятся к коллекциям.

Для документов, которые не подошли ни под одно правило и где LLM неуверена, может потребоваться процесс ручной валидации. В таком случае человек (Data Steward) анализирует файл и относит его к той или иной коллекции. В идеале, чтобы его выбор использовался бы как информация для дообучения модели.

🔸 Этап 4: Регулярное обновление После первого скана можно перейти в "режим мониторинга". Каждый день (или час) каталог данных проверяет: есть ли новые файлы, есть ли измененные или удаленные? Новые файлы проходят через те же правила классификации. Процесс инкрементальный - пересчитываются только изменения, не весь набор целиком. В результате, коллекции автоматически обновляются, аналогично тому, как это происходит при обычной работе каталога данных с СУБД.

✅ Что это дает в итоге? От неуправляемых и непонятных тысяч файлов, мы приходим к нескольким коллекциям, которые легко аудировать. Все как для структурированных данных, но для файлов.