🔄 Операционные метаданные (Operational Metadata) - новый тип данных для вашего каталога

Все привыкли, что каталог данных хранит технические метаданные (БД, схемы, таблицы, представления) и бизнес-метаданные (термины глоссария). Но есть еще один, часто упускаемый из вида пласт — операционные метаданные (Operational Metadata). Это данные о том, как именно используются данные в источниках.

Проще говоря, если технические метаданные отвечают на вопрос "Что это?", а бизнес-метаданные - "Что это значит?", то операционные метаданные отвечают на вопросы:

  • Кто и как часто использует этот датасет?
  • Какие запросы к датасету выполняются чаще всего?
  • Когда была последняя активность?
  • С какими другими датасетами его часто join'ят?

📊 Что можно отнести к операционным метаданным?

  • Статистика запросов из логов СУБД (как в нашем посте от 04.03.2025)
  • История просмотров страниц датасетов в самом каталоге
  • Использование ресурсов (информация о загрузке ЦП, памяти, дискового пространства)
  • Журналы выполнения запросов (детали выполнения различных процессов в системе, такие как время начала, время завершения, статус выполнения)

Data Lineage, кстати, тоже можно отнести к операционным метаданным.

🎯 Зачем это нужно вашему каталогу? Несколько кейсов, где использование операционных метаданных пойдет может улучить пользовательский опыт:

  • Умное ранжирование поиска. Мы уже говорили про учет количества запросов. Но можно пойти дальше: повышать в выдаче датасеты, которые часто используют коллеги из вашего же отдела или которые добавляют в избранное.

  • Проактивное управление жизненным циклом данных. Например - датасет не используют более 6 месяцев? -> алерт владельцу с предложением архивации/удаления

  • Улучшение рекомендаций «Сотрудники, которые смотрели эту витрину, также часто используют вот эту». «К этой таблице часто join'ят вот эти две справочники» - и сразу давать на них ссылки.

🛠 Как это внедрить?

  • Сбор. Тут может оказаться сложнее всего. Необходимо настройте коннекторы для сбора логов запросов из используемых СУБД и, например, складывать эти события в отдельную таблицу.
  • Интеграция с каталогом. Получаем данные, собранные на предыдущем этапе и связываем эти события с объектами в каталоге (таблицами, колонками).
  • Визуализация. Добавляем в интерфейс (страницы объектов, страницы поисковой выдачи...), добавляем в фильтры поиска и реализуем другие механики, позволяющие пользователям использовать собранные нами данные.

❗️Важный момент: Сбор таких метаданных связан с вопросами безопасности и приватности. Агрегируйте данные на уровне команд/отделов, а не отдельных людей (если явно не согласовано обратное), и регулируйте доступ к этой информации.


В этом посте были ссылки, но мы их удалили по правилам Сетки