⚙️ Общий процесс организации классификации неструктурированных данных
Разобрались, что такое коллекции и зачем они нужны. Теперь самый важный вопрос: как это всё реализовать?
🔸 Этап 1: Определение (один раз, в начале)
Перед тем как автоматизировать классификацию, нужно понять, с чем вы работаете. Сначала инвентаризируем: где хранятся документы (S3, локальная FS...), сколько их, кто загружает, как часто обновляются. Это важно для понимания масштаба и сложности процесса.
Далее составляем политики классификации - бизнес-словарь для неструктурированных данных. Это список типов документов, которые компания считает важными.
Например: Invoices, Contracts, Specifications, Reports и так далее.
Для каждого типа определяем: где такие документы обычно находятся, какие ключевые слова встречаются в их наименовании/содержании, кто ими владеет, какие метаданные критичны.
Без этой политики наша система не будет работать. За счет применения такой политики должны классифицироваться около 80% документов .
🔸 Этап 2: Создание правил классификации На основе политик классификации создаются правила, по которым документы будут относиться к той или иной коллекции. При помощи этих правил анализируются имена файлов и содержимое документов.
Например: если имя содержит слово "invoice" и расширение PDF, - файл должен относиться к коллекции Invoice.
Но правила, скорее всего, не позволят нам классифицировать все существующие документы. Какой-то процент документов будут названы странно или находиться в неожиданных местах. Для них используется LLM-классификация: нейросеть анализирует текст документа и определяет, к какой коллекции он относится. Идея в том, чтобы большую часть файлов обрабатывать по правилам, а уже оставшиеся с помощью LLM.
🔸 Этап 3: Первый скан и классификация Каталог данных подключается к хранилищу и сканирует все файлы. Согласно описанным ранее правилам + LLM классификации, файлы относятся к коллекциям.
Для документов, которые не подошли ни под одно правило и где LLM неуверена, может потребоваться процесс ручной валидации. В таком случае человек (Data Steward) анализирует файл и относит его к той или иной коллекции. В идеале, чтобы его выбор использовался бы как информация для дообучения модели.
🔸 Этап 4: Регулярное обновление После первого скана можно перейти в "режим мониторинга". Каждый день (или час) каталог данных проверяет: есть ли новые файлы, есть ли измененные или удаленные? Новые файлы проходят через те же правила классификации. Процесс инкрементальный - пересчитываются только изменения, не весь набор целиком. В результате, коллекции автоматически обновляются, аналогично тому, как это происходит при обычной работе каталога данных с СУБД.
✅ Что это дает в итоге? От неуправляемых и непонятных тысяч файлов, мы приходим к нескольким коллекциям, которые легко аудировать. Все как для структурированных данных, но для файлов.