自建Hadoop数据迁移到阿里云EMR

阿里云E-MapReduce团队 2020-01-09

hdfs hadoop ECS 日志 Apache 配置 镜像 安全组 集群 vpn 系统盘 Image 数据迁移 控制台 EMR

作者:云魁、连辙

最佳实践概述

应用场景

客户在IDC或者公有云环境自建Hadoop集群,数据集中保存在HDFS文件系统用于数据分析任务。但是由于自建HDFS空间限制无法保存长期数据,或者客户有Hadoop集群迁移上云的需求。本实践方案提供如下场景的最佳实践:

基于IPSec VPN隧道 + DistCp(Hadoop原生工具),将数据迁移到阿里云EMR集群,目标存储包括HDFS,阿里云OSS和阿里云EMR的Jindo

技术架构

本实践方案基于如下图所示的技术架构和主要流程编写操作步骤:
image.png

方案优势

  • 安全性
    基于IPSec VPN/专线的方式进行数据安全传输。
  • 低成本
    在阿里云创建Hadoop类型的EMR集群和自建Hadoop集群相比有一定成本优势,同时阿里云EMR可以使用OSS作为底层存储空间,进一步降低成本。

在进行本文操作之前,您需要完成以下


登录 后评论
下一篇
云栖号
8007人浏览
2020-03-04
相关推荐
大数据搬站step by step
1507人浏览
2020-02-19 12:17:30
在 EMR 中使用 Mongo-Hadoop
2535人浏览
2018-06-22 15:36:08
0
0
0
2879