🔹 Hadoop и MapReduce — как это работает? 🔹 Зачем нужен Hadoop и модель MapReduce? 🔸 HDFS (Hadoop Distributed File System) и MapReduce решают проблему: данные не помещаются и не обрабатываются эффективно на одной машине. Хранение и вычисление распределяются по кластеру, поэтому можно работать с терабайтами/петабайтами.
🔸 Map обрабатывает локальные куски (split) и выпускает пары (ключ,значение). Затем происходит shuffle — пересылка/сортировка пар к нужным Reduce-узлам. Reduce агрегирует результаты. Это даёт масштабируемую distributed обработку и устойчивость к сбоям.
🔸 Практический микропример — подсчёт слов. Mapper эмитит (word,1); Reducer суммирует: def map(line): for w in line.split(): emit(w,1)
def reduce(key, values): emit(key, sum(values))
📚 MapReduce = распределённый map + shuffle + reduce над данными в HDFS. Хак: число reducer'ов влияет на баланс и скорость.
➡️ Мы в Telegram - Сетке - ВК Буду рад вашей реакции здесь⬇️
В этом посте были ссылки, но мы их удалили по правилам Сетки