🔹 HDFS: распределённые файлы без боли 🔹 Что делает HDFS (Hadoop Distributed File System) и зачем он в Hadoop? 🔸 HDFS появился потому что один сервер не выдержит очень больших данных и долговременной обработки: без распределённого хранилища файлы не поместятся, обработка будет медленной и уязвимой.
🔸 Файлы в HDFS хранятся как набор блоков (обычно 128MB). Блоки позволяют читать/обрабатывать части файла параллельно и легко перемещать данные между узлами.
🔸 Репликация хранит несколько копий блоков на разных нодах (по умолчанию 3). Это решает проблему аппаратных отказов и повышает доступность данных.
🔸 Нужен при пакетной обработке больших объёмов (MapReduce/Spark): хранить данные рядом с вычислением (data locality) — быстрее и дешевле по сети.
🔸 Хит: подбирайте размер блока под тип файлов и смотрите расположение блоков командой ниже, чтобы отладить балансировку и репликацию.
hdfs fsck /user/data -files -blocks -locations
📚 HDFS = распределённое хранение + блоки + репликация — решение для надёжной и параллельной обработки больших данных.
➡️ Мы в Telegram - Сетке - ВК Буду рад вашей реакции здесь⬇️
В этом посте были ссылки, но мы их удалили по правилам Сетки