文档章节

hadoop分布式部署

lee_ypp
 lee_ypp
发布于 2014/07/14 14:58
字数 1924
阅读 4172
收藏 195


1.硬件环境

共有 3 台机器,均使用的 linux 系统,Java 使用的是 jdk1.6.0。 配置如下:

hadoop1.example.com:192.168.2.1(NameNode)

hadoop2.example.com:192.168.2.2(DataNode)

hadoop3.example.com:192.168.2.3 (DataNode)

hadoop4.example.com:192.168.2.4

主机与IP之间有正确解析

对于 Hadoop 来说,在 HDFS 看来,节点分为 Namenode 和 Datanode,其中Namenode 只有一个, Datanode 可以是很多;在 MapReduce 看来,节点又分为Jobtracker 和 Tasktracker,其中 Jobtracker 只有一个,Tasktracker 可以是很多。我是将 namenode 和 jobtracker 部署在 hadoop1 上, hadoop2, hadoop3 作为 datanode和 tasktracker 。当然你也可以将 namenode ,datanode ,jobtracker,tasktracker 全部部署在一台机器上(这样就是伪分布式)

2.目录结构

由于 Hadoop 要求所有机器上 hadoop 的部署目录结构要相同,并且都有一个相同的用户名的帐户。

我 的 三 台 机 器 上 是 这 样 的 : 都 有 一 个 hadoop 的 帐 户 , 主 目 录是/home/hadoop。

添加用户hadoop

#useradd -u 800 hadoop

#passwd hadoop 给用户hadoop创建密码

下载hadoop-1.2.1.tar.gz

解压    #tar zxf hadoop-1.2.1.tar.gz

#mv hadoop-1.2.1 /home/hadoop/

#cd /home/hadoop

#chown -R hadoop.hadoop hadoop-1.2.1/

#ln -s hadoop-1.2.1 hadoop

切到hadoop用户 #su - hadoop

下载jdk-6u32-linux-x64.bin到家目录下

$sh jdk-6u32-linux-x64.bin

$cd /home/hadoop/

$mv jdk1.6.0_32 hadoop-1.2.1/

$cd hadoop-1.2.1/

创建软链接,以便与日后的更新、升级

$ln -s jdk1.6.0_32 jdk

3.SSH设置

在 Hadoop 启动以后,Namenode 是通过 SSH(Secure Shell)来启动和停止各个节点上的各种守护进程的,这就需要在节点之间执行指令的时候是不需要输入密码的方式,故我们需要配置 SSH 使用无密码公钥认证的方式。

首先要保证每台机器上都装了 SSH 服务器,且都正常启动。实际中我们用的都是 OpenSSH,这是 SSH 协议的一个免费开源实现。

以本文中的 3 台机器为例,现在 hadoop1 是主节点,它需要主动发起 SSH连接到 hadoop2 ,对于 SSH 服务来说, hadoop1 就是 SSH 客户端,而hadoop2,hadoop3 则是 SSH 服务端,因此在 hadoop2,hadoop3 上需要确定 sshd 服务已经启动。简单的说,在 hadoop1 上需要生成一个密钥对,即一个私钥,一个公钥。将公钥拷贝到 hadoop2 上,这样,比如当 hadoop1 向 hadoop2 发起 ssh 连接的时候,hadoop2 上就会生成一个随机数并用 hadoop1 的公钥对这个随机数进行加密并发送给 hadoop1,hadoop1 收到这个加密的数以后用私钥进行解密,并将解密后的数发送回hadoop2,hadoop2 确认解密的数无误后就允许 hadoop1 进行连接了。这就完成了一次公钥认证过程。

对于本文中的 3 台机器,首先在 hadoop1 上生成密钥对:

#su - hadoop

$ssh-keygen 

这个命令将为 hadoop1 上的用户 hadoop 生成其密钥对。生成的密钥对id_rsa,id_rsa.pub,在/home/hadoop/.ssh 目录下。

$ssh-copy-id localhost 

$ssh-copy-id 192.168.2.2

$ssh-copy-id 192.168.2.3

发布密钥到你本地和hadoop2、hadoop3

试着登录本地和hadoop2、hadoop3看是否有密码验证,无密码即验证成功


4.环境变量

在 /home/hadoop/hadoop-1.2.1/conf/ 目 录 下 的 hadoop-env.sh 中 设 置Hadoop 需 要 的 环 境 变 量 , 其 中 JAVA_HOME 是 必 须 设 定 的 变 量 。HADOOP_HOME 变量可以设定也可以不设定,如果不设定, HADOOP_HOME默认的是 bin 目录的父目录,即本文中的/home/hadoop/hadoop。

vim /home/hadoop/hadoop-1.2.1/conf/hadoop-env.sh

export JAVA_HOME=/home/hadoop/hadoop/jdk(第九行)

先进行简单测试:

$cd  /home/hadoop/hadoop/

$mkdir input

$cp conf/* input/

$bin/hadoop jar hadoop-examples-1.2.1.jar

$bin/hadoop jar hadoop-examples-1.2.1.jar grep input output 'dfs[a-z.]+'

$cd output

$cat *

统计文件中的单词:

$bin/hadoop jar hadoop-examples-1.2.1.jar

$bin/hadoop jar hadoop-examples-1.2.1.jar wordcount input test

$cd test/

$cat *

5.hadoop配置文件

$cd /home/hadoop/hadoop/conf

conf/core-site.xml:

<configuration>
     <property>
         <name>fs.default.name</name>
         <value>hdfs://hadoop1.example.com:9000</value>
     </property></configuration>

conf/hdfs-site.xml:

<configuration>
     <property>
         <name>dfs.replication</name>
         <value>2</value>
     </property></configuration>

conf/mapred-site.xml:

<configuration>
     <property>
         <name>mapred.job.tracker</name>
         <value>hadoop1.example.com:9001</value>
     </property></configuration>

伪分布式测试:

$mkdir /home/hadoop/bin

$ln -s /home/hadoop/hadoop/jdk/bin/jps /home/hadoop/bin/

$cd /home/hadoop/hadoop/

$bin/hadoop namenode -format  先进行初始化

$bin/start-all.sh

web测试192.168.2.150070

192.168.2.150030

$rm -fr input/ output/ test/

$bin/hadoop fs -mkdir input

$bin/hadoop fs -put conf input

$bin/hadoop fs -lsr

192.168.2.150075/browseDirectory.jsp?namenodeInfoPort=50070&dir=/

下查看/usr/hadoop/input是否有变化

6.部署Hadoop

前面讲的这么多 Hadoop 的环境变量和配置文件都是在 hadoop1 这台机器上的,现在需要将 hadoop 部署到其他的机器上,保证目录结构一致。

$scp -r /home/hadoop/hadoop hadoop2.example.com:/home/hadoop/

$scp -r /home/hadoop/hadoop hadoop3.example.com:/home/hadoop/

$scp -r .ssh/ hadoop2.example.com:

$scp -r .ssh/ hadoop3.example.com:

注意还要修改以下文件:

$cd /home/hadoop/hadoop/conf

conf/masters

hadoop1.example.com

conf/slaves

hadoop2.example.com
hadoop3.example.com

$ln -s hadoop-1.2.1/ hadoop

$mkdir /home/hadoop/bin

$ln -s /home/hadoop/hadoop/jdk/bin/jps /home/hadoop/bin

至此,可以说,Hadoop 已经在各个机器上部署完毕了,下面就让我们开始启动 Hadoop 吧。

7. 启动 Hadoop

启动之前,我们先要格式化 namenode,先进入~/hadoop/目录,执行下面的命令:

$bin/hadoop namenode –format

不出意外,应该会提示格式化成功。如果不成功,就去 hadoop/logs/目录下去查看日志文件。

下面就该正式启动 hadoop 啦,在 bin/下面有很多启动脚本,可以根据自己的需要来启动。

* start-all.sh 启动所有的 Hadoop 守护。包括 namenode, datanode, jobtracker,tasktrack

* stop-all.sh 停止所有的 Hadoop

* start-mapred.sh 启动 Map/Reduce 守护。包括 Jobtracker 和 Tasktrack

* stop-mapred.sh 停止 Map/Reduce 守护

* start-dfs.sh 启动 Hadoop DFS 守护.Namenode 和 Datanode

* stop-dfs.sh 停止 DFS 守护

在这里,简单启动所有守护:
[hadoop@hadoop1:hadoop]$bin/start-all.sh

$jps

查看JobTracker,Jps,SecondaryNameNode,NameNode是否启动成功。

同样,如果要停止 hadoop,则

[hadoop@hadoop1:hadoop]$bin/stop-all.sh

8. HDFS 操作

运行 bin/目录的 hadoop 命令,可以查看 Haoop 所有支持的操作及其用法,这里以几个简单的操作为例。

建立目录:

[hadoop@hadoop1 hadoop]$bin/hadoop dfs -mkdir testdir

在 HDFS 中建立一个名为 testdir 的目录,复制文件:

[hadoop@hadoop1 hadoop]$bin/hadoop dfs -put /home/large.zip testfile.zip

把 本 地 文 件 large.zip 拷 贝 到 HDFS 的 根 目 录 /user/hadoop/ 下 , 文 件 名 为testfile.zip,查看现有文件:

[hadoop@hadoop1 hadoop]$bin/hadoop dfs -ls

9.hadoop 在线更新节点:

新增节点:

1). 在新增节点上安装 jdk,并创建相同的 hadoop 用户,uid 等保持一致

2). 在 conf/slaves 文件中添加新增节点的 ip

3). 同步 master 上 hadoop 所有数据到新增节点上,路径保持一致

4). 在新增节点上启动服务:

$ bin/hadoop-daemon.sh start datanode

$ bin/hadoop-daemon.sh start tasktracker

5). 均衡数据:

$ bin/start-balancer.sh

(1)如果不执行均衡,那么 cluster 会把新的数据都存放在新的 datanode 上,这样会降低 mapred的工作效率

2)设置平衡阈值,默认是 10%,值越低各节点越平衡,但消耗时间也更长

$ bin/start-balancer.sh -threshold 5

在线删除datanode节点:

1). 在 master 上修改 conf/mapred-site.xml

<property>

<name>dfs.hosts.exclude</name>

<value>/home/hadoop/hadoop-1.2.1/conf/datanode-excludes</value>

</property>

2). 创建 datanode-excludes 文件,并添加需要删除的主机,一行一个

192.168.2.4

3). 在 master 上在线刷新节点

$ bin/hadoop dfsadmin -refreshNodes

此操作会在后台迁移数据,等此节点的状态显示为 Decommissioned,就可以安全关闭了。

4). 你可以通过以下命令查看 datanode 状态

$ bin/hadoop dfsadmin -report

在做数据迁移时,此节点不要参与 tasktracker,否则会出现异常。

在线删除tasktracker 节点:

1). 在 master 上修改 conf/mapred-site.xml

<property>

<name>mapred.hosts.exclude</name>

<value>/home/hadoop/hadoop-1.2.1/conf/tasktracker-excludes</value>

</property>

2. 创建 tasktracker-excludes 文件,并添加需要删除的主机名,一行一个

hadoop4.example.com

3. 在 master 上在线刷新节点

$ bin/hadoop mradmin -refreshNodes

4. 登录 jobtracker 的网络接口,进行查看。
                --@leeypp.foxmail.com








© 著作权归作者所有

共有 人打赏支持
上一篇: 编译安装lnmp
下一篇: VPN服务安装配置
lee_ypp
粉丝 64
博文 45
码字总数 58692
作品 0
程序员
私信 提问
加载中

评论(11)

johncan
johncan
解释得很详细
sunnyair0701
sunnyair0701

引用来自“lee_ypp”的评论

引用来自“ihuotui”的评论

参考intel hadoop管理软件,他使用了Puppet。
puppet已经学习了,感觉不错

不错啊
lee_ypp
lee_ypp

引用来自“LiangShao”的评论

为什么没有配 zookeeper
zookeeper的配置不是必需的
LiangShao
LiangShao
为什么没有配 zookeeper
lee_ypp
lee_ypp

引用来自“kcen”的评论

正在学习
好的,可以一起探讨
kcen
kcen
正在学习
lee_ypp
lee_ypp

引用来自“ihuotui”的评论

参考intel hadoop管理软件,他使用了Puppet。
puppet已经学习了,感觉不错
moli
moli
学习
p
polaris_chen
我看错了,不是自动化部署。
p
polaris_chen
你这个叫什么自动化部署?
完全分布式(四)Sqoop 安装部署及操作示例

本次采用完全分布式系列的hadoop集群,安装配置过程详细参见 完全分布式集群(二)hadoop2.6.5安装部署 Hive在分布式集群上的部署配置参见 完全分布式集群(三)hive-2.1.1安装部署 检查本地...

PeakFang-BOK
10/12
0
0
Hadoop伪分布式安装(HDFS)步骤

1.安装前的准备工作 在进行Hadoop伪分布式安装前要检测虚拟机是否进行了下面的配置: 1. 修改主机名 2. 修改主机名与ip之间的映射关系 3. 配置虚拟机网络可以进行上网 2.伪分布式部署(HDFS)...

yu0_zhang0的博客
2017/12/19
0
0
Spark的Standalone模式安装部署

Spark运行模式 Spark 有很多种模式,最简单就是单机本地模式,还有单机伪分布式模式,复杂的则运行在集群中,目前能很好的运行在 Yarn和 Mesos 中,当然 Spark 还有自带的 Standalone 模式,...

Zero零_度
2016/06/04
38
0
基于Docker一键部署大规模Hadoop集群及设计思路

欢迎关注大数据和人工智能技术文章发布的微信公众号:清研学堂,在这里你可以学到夜白(作者笔名)精心整理的笔记,让我们每天进步一点点,让优秀成为一种习惯! 一、背景: 随着互联网的发展...

李金泽
03/04
0
0
Hadoop3.1.0完全分布式集群部署超详细记录

Hadoop3.1.0完全分布式集群部署,三台服务器部署结构如下github配置文件源码地址 如上图,一共三台机器作为集群,servera作为master,其他两台作为worker。 2.开始部署-前期准备(三台机器都需...

dream_an
05/09
0
0

没有更多内容

加载失败,请刷新页面

加载更多

Vue- 对象语法 v-bind:class与对象语法的使用

我们可以传给 v-bind:class 一个对象,以动态地切换 class 。 <div v-bind:class="{ active: isActive }"></div>//对象语法也就是在v-bind:class绑定一个对象的时候,里面的值将影响最终取值...

文文1
29分钟前
1
0
epoll中使用

1、一个线程epoll_wait时,另一个线程调用epoll_ctl是安全的。 2、使用edge触发,在socket有数据到来后,不收取数据,再次调用epoll_ctl将socket加入,仍会触发下一次动作。 asio用该方法来发...

gelare
57分钟前
1
0
PHP规范PSR2

PSR标准 - PSR-2 为了尽可能的提升阅读其他人代码时的效率,下面例举了一系列的通用规则,特别是有关于PHP代码风格的。 各个成员项目间的共性组成了这组代码规范。当开发者们在多个项目中合作...

geek土拨鼠
今天
5
0
【极简】如何在服务器上安装SSL证书?

本文适合任何人了解,图形化操作。下面以腾讯云为例,并且服务器(linux)也安装了宝塔面板。 1.登陆腾讯云账号进入控制台,找到SSL的产品 2.按要求申请并填写表单,记住私钥密码 3.提交后,待...

皇冠小丑
今天
1
0
深入理解编译器

深入理解编译器 原文出处 欢迎向Rust中文社区投稿,投稿地址,好文将在以下地方直接展示 1 Rust中文社区首页 2 Rust中文社区Rust文章栏目 3 知乎专栏Rust语言 编程语言是如何工作的 从内部理解...

krircc
今天
1
0

没有更多内容

加载失败,请刷新页面

加载更多

返回顶部
顶部