作者:云魁、连辙
最佳实践概述
应用场景
客户在IDC或者公有云环境自建Hadoop集群,数据集中保存在HDFS文件系统用于数据分析任务。但是由于自建HDFS空间限制无法保存长期数据,或者客户有Hadoop集群迁移上云的需求。本实践方案提供如下场景的最佳实践:
基于IPSec VPN隧道 + DistCp(Hadoop原生工具),将数据迁移到阿里云EMR集群,目标存储包括HDFS,阿里云OSS和阿里云EMR的Jindo
技术架构
本实践方案基于如下图所示的技术架构和主要流程编写操作步骤:
方案优势
- 安全性
基于IPSec VPN/专线的方式进行数据安全传输。 - 低成本
在阿里云创建Hadoop类型的EMR集群和自建Hadoop集群相比有一定成本优势,同时阿里云EMR可以使用OSS作为底层存储空间,进一步降低成本。
在进行本文操作之前,您需要完成以下