🔄 Операционные метаданные (Operational Metadata) - новый тип данных для вашего каталога
Все привыкли, что каталог данных хранит технические метаданные (БД, схемы, таблицы, представления) и бизнес-метаданные (термины глоссария). Но есть еще один, часто упускаемый из вида пласт — операционные метаданные (Operational Metadata). Это данные о том, как именно используются данные в источниках.
Проще говоря, если технические метаданные отвечают на вопрос "Что это?", а бизнес-метаданные - "Что это значит?", то операционные метаданные отвечают на вопросы:
- Кто и как часто использует этот датасет?
- Какие запросы к датасету выполняются чаще всего?
- Когда была последняя активность?
- С какими другими датасетами его часто join'ят?
📊 Что можно отнести к операционным метаданным?
- Статистика запросов из логов СУБД (как в нашем посте от 04.03.2025)
- История просмотров страниц датасетов в самом каталоге
- Использование ресурсов (информация о загрузке ЦП, памяти, дискового пространства)
- Журналы выполнения запросов (детали выполнения различных процессов в системе, такие как время начала, время завершения, статус выполнения)
Data Lineage, кстати, тоже можно отнести к операционным метаданным.
🎯 Зачем это нужно вашему каталогу? Несколько кейсов, где использование операционных метаданных пойдет может улучить пользовательский опыт:
-
Умное ранжирование поиска. Мы уже говорили про учет количества запросов. Но можно пойти дальше: повышать в выдаче датасеты, которые часто используют коллеги из вашего же отдела или которые добавляют в избранное.
-
Проактивное управление жизненным циклом данных. Например - датасет не используют более 6 месяцев? -> алерт владельцу с предложением архивации/удаления
-
Улучшение рекомендаций «Сотрудники, которые смотрели эту витрину, также часто используют вот эту». «К этой таблице часто join'ят вот эти две справочники» - и сразу давать на них ссылки.
🛠 Как это внедрить?
- Сбор. Тут может оказаться сложнее всего. Необходимо настройте коннекторы для сбора логов запросов из используемых СУБД и, например, складывать эти события в отдельную таблицу.
- Интеграция с каталогом. Получаем данные, собранные на предыдущем этапе и связываем эти события с объектами в каталоге (таблицами, колонками).
- Визуализация. Добавляем в интерфейс (страницы объектов, страницы поисковой выдачи...), добавляем в фильтры поиска и реализуем другие механики, позволяющие пользователям использовать собранные нами данные.
❗️Важный момент: Сбор таких метаданных связан с вопросами безопасности и приватности. Агрегируйте данные на уровне команд/отделов, а не отдельных людей (если явно не согласовано обратное), и регулируйте доступ к этой информации.
В этом посте были ссылки, но мы их удалили по правилам Сетки