🪧 Чем data linage может быть полезен в каталоге данных? Самое очевидное - он нужен для понимания, откуда берутся данные для определенного датасета и для каких датасетов они являются источником. Но сегодня поговорим про дополнительные варианты использования lineage, которые могут принести ценность с точки зрения процессов управления данными.

📌 Распространение описания В случае, если два датасета или колонки связаны, - в определенных случаях можно переиспользовать описание источника, распространив его для объектов нижестоящих уровней. Тем самым, можно сэкономить время, которое data steward'ы тратят на описание данных.

📌 Наследование владельцев В части случаев, если датасет имеет связь 1к1 со своим родителем - у него будут те же владельцы. Подобное может быть особенно актуально, если датасет является родителем для дешборда в BI.

📌 Автоматизация связи с терминами Если родительская колонка связана с какими-либо терминами, то и дочерние, вероятно могут быть связаны с ними же. Тут может понадобится валидация со стороны пользователя каталога данных.

📌 Отслеживание (не-)использования данных Можно обращать внимание пользователей на датасеты, которые:

  • в качестве источника используют устаревшие или неактуальные датасеты (если соответствующая пометка есть в используемом вами каталоге);
  • не используются для формирования ни одного дешборда и не участвуют в какой-либо интеграции.

📌 Управление доступом Можно сократить время коллег, которые занимаются валидацией доступов, рассмотрев следующий сценарий: если УЗ имеет доступ к датасету, то она будет иметь доступ к датасетам, созданным на его основе

А в следующем посте посмотрим на детали, которые предстоит продумать при реализации, на примере распространения описаний колонок.