一、hadoop伪分布式运行模式介绍
在一台主机模拟多主机。
Hadoop启动NameNode、DataNode、JobTracker、TaskTracker这些守护进程都在同一台机器上运行,是相互独立的Java进程。
在这种模式下,Hadoop使用的是分布式文件系统,各个作业也是由JobTraker服务,来管理的独立进程。在单机模式之上增加了代码调试功能,允许检查内存使用情况,HDFS输入输出,以及其他的守护进程交互。类似于完全分布式模式,因此,这种模式常用来开发测试Hadoop程序的执行是否正确。
二、hadoop伪分布式运行环境搭建
2.1 创建虚拟机
2.2 将虚拟机ip修改为静态ip
2.3 修改主机名
2.4 配置主机名与ip映射
2.5 关闭防火墙
2.6 创建test用户
2.7 使test用户拥有sudo权限
2.8 在/opt目录下创建文件夹
2.9 安装jdk
2.10 安装hadoop
2.11 启动HDFS并运行MapReduce程序
1、修改配置文件
下面三个配置文件的路径为:/opt/module/hadoop-2.7.2/etc/hadoop
(1) 配置:hadoop-env.sh
Linux系统中获取JDK的安装路径:

修改JAVA_HOME 路径:


(2) 配置:core-site.xml
这里要根据ip和端口进行对应的修改


(3) 配置:hdfs-site.xml


2、启动
(1) 格式化NameNode(第一次启动时格式化,以后就不要总格式化)
[test@hadoop150 hadoop-2.7.2]$ bin/hdfs namenode -format
(2) 启动NameNode
[test@hadoop150 hadoop-2.7.2]$ sbin/hadoop-daemon.sh start namenode
(3) 启动DataNode
[test@hadoop150 hadoop-2.7.2]$ sbin/hadoop-daemon.sh start datanode
3、查看状态
(1) 查看是否启动成功

(2) web端查看hdfs文件系统
在浏览器中输入:
http://192.168.1.150:50070/dfshealth.html#tab-overview
(3) 查看产生的Log日志
当前目录:/opt/module/hadoop-2.7.2/logs
(4) 思考:为什么不能一直格式化NameNode,格式化NameNode,要注意什么?


注意:格式化NameNode,会产生新的集群id,导致NameNode和DataNode的集群id不一致,集群找不到已往数据。所以,格式化NameNode时,一定要先删除data数据和log日志,然后再格式化NameNode。
4、测试
(1) 在HDFS文件系统上创建一个input文件夹

本文详细介绍了如何在单台主机上搭建Hadoop的伪分布式运行环境,包括创建虚拟机、配置网络、安装JDK和Hadoop,以及启动和测试HDFS、MapReduce和YARN。此外,还涉及了配置历史服务器和日志聚集功能。

3213

被折叠的 条评论
为什么被折叠?



