🗺 Data Atlas → как перестать заставлять людей описывать данные вручную

В работе с данными есть парадокс, который многим до боли знаком. Мы инвестируем в платформы, каталоги, витрины, AI — а люди всё равно тратят часы на поиск, расспросы и переписки «а где взять вот этот атрибут?».

Мы решили посмотреть на эту проблему честно — глазами бизнес-пользователя, аналитика и администратора данных. И так родился Data Atlas — навигатор в океане данных.

Боль №1: «Поиск для профессионалов»

Сценарий, который видел каждый: 1. Бизнес-пользователь заходит в каталог, чтобы найти данные.​ 2. Вводит запрос. Получает тысячи результатов. 3. Витрины без описания, поля без пояснений, дубли, артефакты, «мёртвые» объекты.

Цитата из реального чата: 💬 «Поиск данных не то что долгий – он для профессионалов»

Боль №2: аналитики, которые охотятся, а не анализируют

У аналитиков своя реальность:

Была таблица web_hits_and_visits — работала быстро, понятное поле business_dt.

Появился новый объект web_visits_hits_all — работает медленно, business_dt переименован в pv_date, описание толком нигде не отражено.

В итоге: 🚨Запросы ломаются. 🛫Люди пишут друг другу, кто и что поменял. 🕵️‍♀️Вместо работы с гипотезами и моделями — расследование «куда делось мое поле».

🤑 А сколько стоит ручное описание данных? Допустим, на практике:

Полей ~684 840.​ Описание одного поля занимает ~2 минуты.​ По ставкам получается ~50 млн рублей в год только на ручное описание полей и объектов.​

💬 И это без учёта того, что пока поля описываются, схема уже успевает измениться.

#️⃣ Решение: Data Atlas

💭 Data Atlas — это надстройка над существующей инфраструктурой данных и документацией, а не «ещё один каталог»

Логика такая:

Парсинг структуры документов Берём то, что уже есть: техспеци, Confluence, описания витрин, глоссарий, SQL, стандарты.​

Семантическое чанкирование Разбиваем этот массив на смысловые куски: где определение, где пример, где методология, где регламент загрузки.​

Векторизация и граф знаний Превращаем текст в векторные представления, увязываем термины, таблицы, поля, бизнес-сущности и справочники в граф.​

Сверху на это садится LangChain-оркестрация и LLM, которая умеет: ✔️ Понимать запрос на «человеческом языке». ✔️ Находить релевантные данные и определения. ✔️ Генерировать SQL и объяснить, из каких таблиц и почему.​

Если вам интересна эта тема: можем сделать отдельный пост с техническими деталями и типовыми граблями. Ставьте лайки 😉