E-MapReduce HDFS文件快速CRC校验工具介绍-阿里云开发者社区

E-MapReduce HDFS文件快速CRC校验工具介绍

2017-08-01 4651

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 在大数据应用场景下经常有数据文件的迁移工作，如果保障迁移之后数据的完整性是一个很常见的问题。本文就给大家介绍一下在大数据场景下，如何用工具快速对比文件。

背景

在大数据应用场景下经常有数据文件的迁移工作，如果保障迁移之后数据的完整性是一个很常见的问题。对本地文件系统的数据而言，我们一般用md5工具（在Linux下可用md5sum命令）。

而对云存储上的文件来说，md5不一定满足需求。比如阿里云OSS文件并没有提供md5校验值，而是提供了CRC64校验值。本文就给大家介绍一下在大数据场景下，如何用工具快速对比文件。

OSSUtil

首先我们使用OSS官方提供ossutil工具，可以方便的得到云端OSS文件的CRC64：

[hadoop@emr-header-1 ~]$ ossutil stat oss://bucket/file.txt
ACL                         : default
Accept-Ranges               : bytes
Content-Length              : 500000000
Content-Type                : application/octet-stream
Etag                        : 1C1CE59DC84E49EC89EE6570A3608597-96
Last-Modified               : 2017-08-01 11:16:27 +0800 CST
Owner                       : onwerid
X-Oss-Hash-Crc64ecma        : 5376366475988344152
X-Oss-Object-Type           : Multipart
X-Oss-Storage-Class         : Standard
0.097086(s) elapsed

其中的 X-Oss-Hash-Crc64ecma : 5376366475988344152 就是校验值。

ossutil hash命令还能得到本地文件的CRC64值：

[hadoop@emr-header-1 ~]$ ossutil hash file.txt
CRC64-ECMA                  : 5376366475988344152

将两个CRC值进行比较，就可以知道从本地上传到OSS上的文件是否成功。

但是，上面的方法只对单个文件有用，如果你的文件是放在分布式文件系统，比如E-MapReduce上的HDFS，有需要备份数据到OSS上，用OSSUtil工具可能就太慢了。下面将引入一个新的工具。

E-MapReduce Distcp和DistCheck

DistCp

首先用EMR distcp工具将数据从HDFS导入到OSS上：

hadoop distcp /user/hadoop/terasort-10g oss://emr-bucket/upload

这里的原始目录有10G，文件列表是：
/user/hadoop/terasort-10g/input/part-m-00000
/user/hadoop/terasort-10g/input/part-m-00001
...
/user/hadoop/terasort-10g/input/part-m-00020

将文件列表保持成一个文件 list.txt ，并上传到 HDFS 上 /user/hadoop/list.txt

hadoop fs -put list.txt /user/hadoop/list.txt

下载工具

然后，需要你下载本文附件中的压缩包，解压缩之后可以得到两个文件 streaming.jar 和 crctool。其中crctool是一个可以在本地运行的可执行文件（注意：只能在Linux 64位环境下执行），功能和ossutil的hash功能类似，但它只支持从标准输入中读取数据，比如：

cat file.txt | ./crctool

运行工具

接下去就可以运行DistCheck工具了，具体命令如下：

hadoop jar streaming.jar -Dmapred.reduce.tasks=1 -mapper crctool -file crctool -input /user/hadoop/list.txt -output /user/hadoop/distcheck-out

查看结果

查看工具输出的结果：

[hadoop@emr-header-1 ~]$ hadoop  fs -cat /user/hadoop/distcheck-out/part-00000
hdfs://emr-header-1:9000/user/hadoop/terasort-10g/input/part-m-00000: 5376366475988344152
hdfs://emr-header-1:9000/user/hadoop/terasort-10g/input/part-m-00001: 11439160807767203705
hdfs://emr-header-1:9000/user/hadoop/terasort-10g/input/part-m-00002: 2122411653175000878
hdfs://emr-header-1:9000/user/hadoop/terasort-10g/input/part-m-00003: 7064261157479130820
...

这是HDFS上文件的CRC值，可以和OSS上的文件做比较：

[hadoop@emr-header-1 ~]$ hadoop fs -ls oss://emr-bucket/upload/terasort-10g/input  |grep part | awk '{print $6}' | xargs -L1 ./ossutil stat  | grep Crc64
X-Oss-Hash-Crc64ecma        : 5376366475988344152
X-Oss-Hash-Crc64ecma        : 11439160807767203705
X-Oss-Hash-Crc64ecma        : 2122411653175000878
X-Oss-Hash-Crc64ecma        : 7064261157479130820
...

E-MapReduce HDFS文件快速CRC校验工具介绍

背景

OSSUtil

E-MapReduce Distcp和DistCheck

DistCp

下载工具

运行工具

查看结果

开源大数据平台 E-MapReduce

热门文章

最新文章

相关课程

相关电子书