ClickHouse — стандарт в аналитике данных
Обычно СУБД ассоциируются с такими названиями, как Oracle DB, PostgreSQL и MySQL. Однако все чаще в содержании вакансий — преимущественно связанных с аналитикой данных — можно встретить ClickHouse. Поскольку эта СУБД успела стать стандартом там, где бизнес-задачи требуют быстрой обработки до нескольких ТБ информации. Именно на нем в основном сооружают витрины данных, впоследствии используемые для построения BI-дашбордов и прототипирования обобщающих ML-моделей. Вдобавок ClickHouse востребован тогда, когда речь идет о записи и хранении всякого рода телеметрии.
Почему так вышло?
П. 1) ClickHouse является колоночной СУБД. То есть при ординарных DQL-операциях запрос обращается к столбцам, а не строкам. Благодаря чему подсчет метрик с помощью групповых функций происходит в 10-100 раз быстрее.
П. 2) Данные обрабатываются не построчно, а пакетами. Это ускоряет фильтрацию и агрегацию в 4-8 раз.
П. 3) В ClickHouse сделана ставка на императивный параллелизм, позволяя таким образом распределение операций не только по всем ядрам CPU, но даже по разным серверам.
П. 4) Движок MergeTree упорядоченно сортирует данные по конкретному столбцу, способствуя более эффективному сжатию.
П. 5) Помимо этого, дополнительное применение специализированных кодеков делает возможным сжатие информации в 10 раз сильнее, чем в условном PostgreSQL.
Лично я смог эмпирически ощутить мощь и величие ClickHouse во время работы BI-аналитиком. А сталкивались ли Вы так или иначе с данной СУБД?
· 09.08
Пока не сталкивался. Считаю пока, что заложенная идея оптимизации тут хорошая, но подойдет только для статичных проектов. А так пока можно подогнать postgres пока под большую часть задач, особено, если orm из кода не накладывает ограничений, осложняющих партиционирование и шардирование.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён