Как там в инженерии данных обстоят дела?
11 июля дан был старт моего потока по профессии «Инженер данных» и я там в качестве ментора всего курса. Это не просто курс, это симулятор боевых задач. У каждого блока, будь то SQL, Python или Hadoop есть свой преподаватель, который разбирает все вопросы. Я же отвечаю за всю команду в целом, расширяю возможности симулятора, путем проведения воркшопов по новым технологиям, свежих задач с собеседований и поддержания духа команды.
Общаемся мы в корпоративном мессенджере «Пачка». Уже была проведена первая брифинг встреча с командой студентов, ключевые проблемы внесли в протокол и уже начали разбирать эти проблемы по частям. Также ко мне обратилась девочка на индивидуальную менторскую сессию, которую мы провели в субботу. Она молодец, молодая, 22 года, амбициозная, считаю, что уже имеет неплохую почву под ногами и сильную зп, но есть запрос, чтобы расти еще выше 💪 Чтож, следующая встреча с ней будет в режиме live-coding, где узнаем ее слабые стороны и усилим их. Драйва придает сжатые сроки подготовки, это всего лишь 2 месяца. Цель не то что просто подготовиться, а за 2 месяца уже на руках иметь несколько офферов. Думаю, проблем нет, сделаем 🔥
Я получил все необходимые корпоративные доступы в Simulative, чтобы видеть прогресс своей команды и уже вижу несогласонность в данных 🤔 это нормальная практика, доведем точность и актуальность данных до стадии Data Quality Management.
Пока я смотрел на витрину прогресса учеников в метабейс подумал, а не сделать ли мне из этой витрины лидер-борд для команды 🤔 Сразу в голове такой ETL процесс:
- пишу скрипт, который локально в рамках моих прав доступа, дергает данные из метаб- ейс далее данные чистятся от лишней системной информации, агрегируются по пользователям и по уровню вложенности остаются только на первом (общ- ем) следующим этапом будет подмена конфиденциальной информации на общедоступную, а именно email будет заменен на логин или имя в пачке, здесь же маппинг данных с прогрес- сом уже чистые данные буду трассироваться например в облачную таблицу например google she- ets и финальным моментом делаю коннектор к своей облачной таблице в google looker stu- d- io
В итоге этих манипуляций получаем дашборд по прогрессу команды с динамикой по неделям и месяцам, без конфиденциальных данных и изоляций от корпоративных данных.
Именно так рассуждают инженеры данных 😎
А теперь ловите материал по проектированию баз данных ⚙️