Основные мысли со второго дня конфы

📍Шаблонная архитектура data platform с точки зрения хранения данных: S3 + Greenplum + Clickhouse

S3 - объектное хранилище, можно писать любые форматы с любой структурой данных. Используется как часть Data Lake и промежуточным слоем хранения данных между источниками и core Greenplum - основная БД хранения данных по слоям. Удобен, т.к. open source и является MPP-решением, что позволяет работать с большими объемами данных Clickhouse - базенка для аналитических витрин, используют в основном для BI слоя и отчетов с возможностью real time аналитики. Понятное решение, т.к. клик является колоночной базой, что позволяет более быстро крутить метрики витрин чем напрямую это делать в GP.

📍Со стороны ETL было удивлением, что многие уже внедрили dbt для описания правил трансформации данных, думал что тренд dbt с запада будет к нам чуть дольше идти. В остальном никакие новые тренды не услышал, все стандартно: Airflow как оркестратор, Kafka для очередей.

📍У многих болит тема Data Governance, особенно у тех кто переходит в Data mesh. Ну правильно, чтобы не получить data mess вместо data mesh - нужно внедрять общие практики управления данными (Federated DG/DM) на уровне всей компании)