备案控制台

开发者社区大数据文章正文

《Hadoop MapReduce实战手册》一2.1 简介

2017-05-02 1458

版权

版权声明：

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介：

本节书摘来异步社区《Hadoop MapReduce实战手册》一书中的第2章，第2.1节，作者：【美】Srinath Perera , Thilina Gunarathne 译者：杨卓荦责编：杨海玲，更多章节内容可以访问云栖社区“异步社区”公众号查看。

2.1 简介

Hadoop MapReduce实战手册
Hadoop分布式文件系统（Hadoop Distributed File System，HDFS）被设计成适合运行在低廉的通用硬件上的面向块结构的分布式文件系统。HDFS支持海量数据存储，并提供高吞吐量的数据访问。HDFS通过跨多个节点的冗余方式存储文件数据，以确保容错性和高聚合带宽。

HDFS是Hadoop MapReduce计算默认使用的分布式文件系统。Hadoop在处理存储在HDFS上的数据时支持数据本地化感知。然而，HDFS也可以用作一个通用的分布式文件系统。HDFS架构主要由一个用于处理文件系统元数据的中央NameNode以及很多个用于存储真实数据块的DataNode组成。HDFS数据块通常是粗粒度的，适合存储大数据产品。

1.5节和第1章中的其他各节说明了如何部署HDFS，并对HDFS的基本操作给出了一个概述。本章将学习一组精心挑选的高级HDFS操作，在使用Hadoop MapReduce进行大规模数据处理时，这些操作将十分有用，同时，也适用于使用HDFS作为一个独立的分布式文件系统用于非MapReduce场景。

文章标签：

分布式计算

存储

大数据

Hadoop

关键词：

mapreduce hadoop

hadoop mapreduce

hadoop简介

开源大数据平台 E-MapReduce hadoop

开源大数据平台 E-MapReduce简介

异步社区

目录

相关文章

yuanzhengme

|

4天前

|

存储分布式计算监控

Hadoop【基础知识 01+02】【分布式文件系统HDFS设计原理+特点+存储原理】（部分图片来源于网络）【分布式计算框架MapReduce核心概念+编程模型+combiner&partitioner+词频统计案例解析与进阶+作业的生命周期】（图片来源于网络）

【4月更文挑战第3天】【分布式文件系统HDFS设计原理+特点+存储原理】（部分图片来源于网络）【分布式计算框架MapReduce核心概念+编程模型+combiner&partitioner+词频统计案例解析与进阶+作业的生命周期】（图片来源于网络）

yuanzhengme

141 2 2

听风de歌

|

3天前

|

分布式计算并行计算搜索推荐

Hadoop MapReduce计算框架

【5月更文挑战第10天】HadoopMapReduce计算框架

听风de歌

13 3 3

ZShiJ

|

4天前

|

分布式计算数据可视化 Hadoop

大数据实战——基于Hadoop的Mapreduce编程实践案例的设计与实现

大数据实战——基于Hadoop的Mapreduce编程实践案例的设计与实现

ZShiJ

39 0 0

然然学长

|

4天前

|

分布式计算资源调度 Hadoop

java与大数据：Hadoop与MapReduce

java与大数据：Hadoop与MapReduce

然然学长

27 0 0

yuanzhengme

|

4天前

|

分布式计算监控 Hadoop

Hadoop【基础知识 02】【分布式计算框架MapReduce核心概念+编程模型+combiner&partitioner+词频统计案例解析与进阶+作业的生命周期】（图片来源于网络）

【4月更文挑战第3天】Hadoop【基础知识 02】【分布式计算框架MapReduce核心概念+编程模型+combiner&partitioner+词频统计案例解析与进阶+作业的生命周期】（图片来源于网络）

yuanzhengme

59 0 0

极客李华

|

4天前

|

存储分布式计算监控

Hadoop的JobTracker和TaskTracker在MapReduce中的作用是什么？

Hadoop的JobTracker和TaskTracker在MapReduce中的作用是什么？

极客李华

61 0 0

听风de歌

|

4天前

|

存储分布式计算 Hadoop

大数据处理架构Hadoop

【4月更文挑战第10天】Hadoop是开源的分布式计算框架，核心包括MapReduce和HDFS，用于海量数据的存储和计算。具备高可靠性、高扩展性、高效率和低成本优势，但存在低延迟访问、小文件存储和多用户写入等问题。运行模式有单机、伪分布式和分布式。NameNode管理文件系统，DataNode存储数据并处理请求。Hadoop为大数据处理提供高效可靠的解决方案。

听风de歌

95 2 2

桃李春风一杯酒

|

4天前

|

分布式计算 Hadoop 大数据

大数据技术与Python：结合Spark和Hadoop进行分布式计算

【4月更文挑战第12天】本文介绍了大数据技术及其4V特性，阐述了Hadoop和Spark在大数据处理中的作用。Hadoop提供分布式文件系统和MapReduce，Spark则为内存计算提供快速处理能力。通过Python结合Spark和Hadoop，可在分布式环境中进行数据处理和分析。文章详细讲解了如何配置Python环境、安装Spark和Hadoop，以及使用Python编写和提交代码到集群进行计算。掌握这些技能有助于应对大数据挑战。

桃李春风一杯酒

365 1 1

桃李春风一杯酒

|

4天前

|

存储分布式计算 Hadoop

【专栏】Hadoop，开源大数据处理框架：驭服数据洪流的利器

【4月更文挑战第28天】Hadoop，开源大数据处理框架，由Hadoop Common、HDFS、YARN和MapReduce组成，提供大规模数据存储和并行处理。其优势在于可扩展性、容错性、高性能、灵活性及社区支持。然而，数据安全、处理速度、系统复杂性和技能短缺是挑战。通过加强安全措施、结合Spark、自动化工具和培训，Hadoop在应对大数据问题中保持关键地位。

桃李春风一杯酒

24 1 1

程序员三木

|

4天前

|

分布式计算 Hadoop 大数据

[大数据] mac 史上最简单 hadoop 安装过程

[大数据] mac 史上最简单 hadoop 安装过程

程序员三木

15 1 1

热门文章

最新文章

数据分享|基于Python、Hadoop零售交易数据的Spark数据处理与Echarts可视化分析

Hadoop节点网络设备与交换机检查

Hadoop节点扩容网络设备与交换机检查

Hadoop节点资源扩展环境部署

Hadoop节点扩容检查物理连接

Hadoop节点扩展配置DNS和主机名解析

Hadoop数据块分散存储与副本创建

[绝对要收藏]配置hadoop完全分布式环境

Hadoop的运行模式

hadoop的伪分布式搭建-带网盘

阿里云E-MapReduce Trino专属集群外连引擎及权限控制踩坑实践

通过比喻理解-MapReduce的数据处理流程

如何在MapReduce中处理多个输入文件？

MapReduce的优缺点是什么？

MapReduce中的Combiner函数的作用和使用场景

如何在MapReduce中处理数据倾斜问题？

MapReduce中的Map和Reduce函数分别是什么作用？

什么是MapReduce？请简要解释其工作原理。

MapReduce编程：检索特定群体搜索记录和定义分片操作

MapReduce编程：自定义分区和自定义计数器

相关课程

更多

大数据实战项目：反爬虫系统（Lua+Spark+Redis+Hadoop框架搭建）第一阶段

大数据实战项目 - 反爬虫系统（Lua+Spark+Redis+Hadoop框架搭建）第六阶段

大数据实战项目 - 反爬虫系统（Lua+Spark+Redis+Hadoop框架搭建）第七阶段

大数据Hadoop快速入门

Hadoop快速入门

Hadoop企业优化及扩展案例

相关电子书

更多

《构建Hadoop生态批流一体的实时数仓》

零基础实现hadoop 迁移 MaxCompute 之数据

CIO 指南:如何在SAP软件架构中使用Hadoop

相关实验场景

更多

搭建Hadoop环境

下一篇

2024年阿里云免费云服务器及学生云服务器申请教程参考