《Hadoop MapReduce实战手册》一2.7 设置文件冗余因子-阿里云开发者社区

《Hadoop MapReduce实战手册》一2.7 设置文件冗余因子

2017-05-02 2094

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介：

本节书摘来异步社区《Hadoop MapReduce实战手册》一书中的第2章，第2.7节，作者：【美】Srinath Perera , Thilina Gunarathne 译者：杨卓荦责编：杨海玲，更多章节内容可以访问云栖社区“异步社区”公众号查看。

2.7 设置文件冗余因子

Hadoop MapReduce实战手册
HDFS跨集群存储文件时，会把文件切分成粗粒度的、大小固定的块。出于容错的目的，这些粗粒度的数据块会被复制到不同的DataNode中。数据块的冗余有助于增加数据本地化MapReduce计算的能力，同时也可以增加总的数据访问带宽。减少冗余因子则有助于节省HDFS上的存储空间。

HDFS冗余因子（HDFS replication factor）是文件级属性，可以基于每个文件进行单独配置。本节将展示如何通过改变HDFS部署的默认冗余因子来影响以后创建的新文件，如何在创建HDFS文件的时候指定自定义冗余因子，以及如何改变现有的HDFS文件的冗余因子。

操作步骤

要使用NameNode的配置文件来设置文件的冗余因子，需要添加或修改`javascript
$HADOOP_HOME/conf/

hdfs-site.xml中的dfs.replication属性。这种修改不会改变那些HDFS中已有的文件的冗余因子。新的冗余因子只会影响在参数修改后新复制的文件。

　 dfs.replication
　 2

2. 也可以在上传文件时在命令行中设置文件的冗余因子，如下所示：

bin/hadoopfs -D dfs.replication=1 -copyFromLocal non-critical-

file.txt /user/foo

3. 使用setrep命令可以改变HDFS中已有的文件或文件路径的冗余因子。

bin/hadoopfs -setrep 2 non-critical-file.txt

Replication 3 set: hdfs://myhost:9000/user/foo/non-critical-file.txt

工作原理
setrep命令的语法如下：

hadoopfs -setrep [-R]

使用setrep命令的<path>参数可以指定需要改变冗余因子的HDFS路径。使用-R选项可以递归地为一个目录中的所有文件和目录设置冗余因子。

更多参考
使用ls命令列出文件时，会显示文件的冗余因子。

bin/hadoopfs -ls

Found 1 item
-rw-r--r--2foo supergroup ... /user/foo/non-critical-file.txt

《Hadoop MapReduce实战手册》一2.7 设置文件冗余因子

2.7 设置文件冗余因子

热门文章

最新文章

相关课程

相关电子书

相关实验场景