🗺 Data Atlas → как перестать заставлять людей описывать данные вручную
В работе с данными есть парадокс, который многим до боли знаком. Мы инвестируем в платформы, каталоги, витрины, AI — а люди всё равно тратят часы на поиск, расспросы и переписки «а где взять вот этот атрибут?».
Мы решили посмотреть на эту проблему честно — глазами бизнес-пользователя, аналитика и администратора данных. И так родился Data Atlas — навигатор в океане данных.
Боль №1: «Поиск для профессионалов»
Сценарий, который видел каждый: 1. Бизнес-пользователь заходит в каталог, чтобы найти данные. 2. Вводит запрос. Получает тысячи результатов. 3. Витрины без описания, поля без пояснений, дубли, артефакты, «мёртвые» объекты.
Цитата из реального чата: 💬 «Поиск данных не то что долгий – он для профессионалов»
Боль №2: аналитики, которые охотятся, а не анализируют
У аналитиков своя реальность:
Была таблица web_hits_and_visits — работала быстро, понятное поле business_dt.
Появился новый объект web_visits_hits_all — работает медленно, business_dt переименован в pv_date, описание толком нигде не отражено.
В итоге: 🚨Запросы ломаются. 🛫Люди пишут друг другу, кто и что поменял. 🕵️♀️Вместо работы с гипотезами и моделями — расследование «куда делось мое поле».
🤑 А сколько стоит ручное описание данных? Допустим, на практике:
Полей ~684 840. Описание одного поля занимает ~2 минуты. По ставкам получается ~50 млн рублей в год только на ручное описание полей и объектов.
💬 И это без учёта того, что пока поля описываются, схема уже успевает измениться.
#️⃣ Решение: Data Atlas
💭 Data Atlas — это надстройка над существующей инфраструктурой данных и документацией, а не «ещё один каталог»
Логика такая:
Парсинг структуры документов Берём то, что уже есть: техспеци, Confluence, описания витрин, глоссарий, SQL, стандарты.
Семантическое чанкирование Разбиваем этот массив на смысловые куски: где определение, где пример, где методология, где регламент загрузки.
Векторизация и граф знаний Превращаем текст в векторные представления, увязываем термины, таблицы, поля, бизнес-сущности и справочники в граф.
Сверху на это садится LangChain-оркестрация и LLM, которая умеет: ✔️ Понимать запрос на «человеческом языке». ✔️ Находить релевантные данные и определения. ✔️ Генерировать SQL и объяснить, из каких таблиц и почему.
Если вам интересна эта тема: можем сделать отдельный пост с техническими деталями и типовыми граблями. Ставьте лайки 😉