ClickHouse — стандарт в аналитике данных

Обычно СУБД ассоциируются с такими названиями, как Oracle DB, PostgreSQL и MySQL. Однако все чаще в содержании вакансий — преимущественно связанных с аналитикой данных — можно встретить ClickHouse. Поскольку эта СУБД успела стать стандартом там, где бизнес-задачи требуют быстрой обработки до нескольких ТБ информации. Именно на нем в основном сооружают витрины данных, впоследствии используемые для построения BI-дашбордов и прототипирования обобщающих ML-моделей. Вдобавок ClickHouse востребован тогда, когда речь идет о записи и хранении всякого рода телеметрии.

Почему так вышло?

П. 1) ClickHouse является колоночной СУБД. То есть при ординарных DQL-операциях запрос обращается к столбцам, а не строкам. Благодаря чему подсчет метрик с помощью групповых функций происходит в 10-100 раз быстрее.

П. 2) Данные обрабатываются не построчно, а пакетами. Это ускоряет фильтрацию и агрегацию в 4-8 раз.

П. 3) В ClickHouse сделана ставка на императивный параллелизм, позволяя таким образом распределение операций не только по всем ядрам CPU, но даже по разным серверам.

П. 4) Движок MergeTree упорядоченно сортирует данные по конкретному столбцу, способствуя более эффективному сжатию.

П. 5) Помимо этого, дополнительное применение специализированных кодеков делает возможным сжатие информации в 10 раз сильнее, чем в условном PostgreSQL.

Лично я смог эмпирически ощутить мощь и величие ClickHouse во время работы BI-аналитиком. А сталкивались ли Вы так или иначе с данной СУБД?