Hadoop大数据平台实战(00)：Linux Ubuntu 18.04实战安装大数据Hadoop 3.1.2版本单节点模式-阿里云开发者社区

Hadoop大数据平台实战(00)：Linux Ubuntu 18.04实战安装大数据Hadoop 3.1.2版本单节点模式

2019-03-30 3160

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： Linux Ubuntu 18.04实战安装大数据Hadoop 3.1.2版本

Linux Ubuntu 18.04实战安装大数据Hadoop 3.1.2版本。这里分别选择最新的Ubuntu系统 18.04，以及最新的Hadoop版本3.1.2
Hadoop是开源免费的大数据方案，官方网站https://hadoop.apache.org/，核心的组件都是使用Java开发，也是目前也是最流行的，使用最广泛的大数据解决方案，包括几十个框架和工具。
hadoop有3种模式，我们先使用最简单的模式，来安装实战学习Hadoop。
1）单机模式Local (Standalone) Mode
2）伪分布式Pseudo-Distributed Mode
3）完全分布式Fully-Distributed Mode

1、安装JDK
安装开源的JDK，免费，不会引起收费问题。

sudo apt install default-jdk

查看安装版本 Java -version

2、安装SSH
sudo apt-get install openssh-server openssh-client

ssh-keygen -t rsa -P ""
cat $HOME/.ssh/id_rsa.pub >> $HOME/.ssh/authorized_keys

测试登录，不需要密码：
ssh localhost
3、下载最新版本Hadoop
为了速度我们选择清华大学镜像，服务器，

wget http://mirrors.tuna.tsinghua.edu.cn/apache/hadoop/common/hadoop-3.1.2/hadoop-3.1.2.tar.gz

4、安装Hadoop
等待下载完毕，解压，然后进行安装配置

tar xzvf hadoop-3.1.2.tar.gz
mv hadoop-3.1.2 /usr/local/hadoop

查看hadoop是否安装成功

sudo ./bin/hadoop version

5、创建Hadoop账号
为hadoop创建专用账户，并设置为超级用户

sudo addgroup hadoop
sudo adduser --ingroup hadoop hadoopuser
//加为超级用户
sudo adduser hadoopuser sudo

6、配置Hadoop环境变量
在.bashrc文件中添加hadoop环境变量，使用下面的命令

sudo vim ./.bashrc

然后塞入下面的配置，根据实际路径为准：

export HADOOP_HOME=/home/frankxulei/hadoop
export HADOOP_INSTALL=$HADOOP_HOME
export HADOOP_MAPRED_HOME=$HADOOP_HOME
export HADOOP_COMMON_HOME=$HADOOP_HOME
export HADOOP_HDFS_HOME=$HADOOP_HOME
export YARN_HOME=$HADOOP_HOME
export HADOOP_COMMON_LIB_NATIVE_DIR=$HADOOP_HOME/lib/native
export PATH=$PATH:$HADOOP_HOME/sbin:$HADOOP_HOME/bin

使生效：
source ./.bashrc

7、Hadoop测试例子
我们直接Hadoop自带的示例来测试单机模式是否正常工作。创建input目录，然后拷贝测试文本文件到input中，然后执行hadoop的Job分析结果。
本地创建input文件夹：

mkdir ~/input

拷贝测试数据文件到这个文件夹中：

cp /usr/local/hadoop/etc/hadoop/*.xml ~/input

运行下面的命令，mapreduce分析出出a开头的单词频率

bin/hadoop jar /usr/local/hadoop/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.1.2.jar grep ./input/ ./output 'a[a-z.]+'

等待漫长的分析计算过程结束，你会看到hadoop不断输出日志信息，读取、清洗、统计结果

在输出目录上运行cat来检查大数据分析的结果如下：

cat ~/output/*

结果信息安装不同的单词，频率倒序输出结果，如图所示，表示Hadoop分析过程成功执行

8、管理界面
启动Hadoop可以在http://localhost:9870地址，查看Hadoop服务运行状态信息

后续我们还有Hadoop集群模式，等复杂的实战配置。
阿里巴巴Java群超过4800人
进群方式：钉钉扫码入群

阿里巴巴MongoDB群

参考http://hadoop.apache.org/docs/stable/hadoop-project-dist/hadoop-common/SingleCluster.html#Fully-Distributed_Operation

相关实践学习

简单用户画像分析

本场景主要介绍基于海量日志数据进行简单用户画像分析为背景，如何通过使用DataWorks完成数据采集、加工数据、配置数据质量监控和数据可视化展现等任务。

SaaS 模式云数据仓库必修课

本课程由阿里云开发者社区和阿里云大数据团队共同出品，是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法，从场景到实践，体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库，助力开发者学习了解先进的技术栈，并能在实际业务中敏捷的进行大数据分析，赋能企业业务。通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景，可应用MaxCompute实现数仓搭建，快速进行大数据分析。适合大数据工程师、大数据分析师大量数据需要处理、存储和管理，需要搭建数据仓库？学它！没有足够人员和经验来运维大数据平台，不想自建IDC买机器，需要免运维的大数据平台？会SQL就等于会大数据？学它！想知道大数据用得对不对，想用更少的钱得到持续演进的数仓能力？获得极致弹性的计算资源和更好的性能，以及持续保护数据安全的生产环境？学它！想要获得灵活的分析能力，快速洞察数据规律特征？想要兼得数据湖的灵活性与数据仓库的成长性？学它！出品人：阿里云大数据产品及研发团队专家产品 MaxCompute 官网 https://www.aliyun.com/product/odps 

Hadoop大数据平台实战(00)：Linux Ubuntu 18.04实战安装大数据Hadoop 3.1.2版本单节点模式

Java技术进阶

热门文章

最新文章

相关课程

相关电子书

相关实验场景

推荐镜像

Hadoop大数据平台实战(00)：Linux Ubuntu 18.04实战安装大数据Hadoop 3.1.2版本 单节点模式

Java技术进阶

热门文章

最新文章

相关课程

相关电子书

相关实验场景

推荐镜像

Hadoop大数据平台实战(00)：Linux Ubuntu 18.04实战安装大数据Hadoop 3.1.2版本单节点模式