Hadoop 安装与配置指南

1. 安装与配置 Hadoop

上传并解压 (仅在 hadoop01 上执行)

rz  # 上传 Hadoop 压缩包
tar -zxvf hadoop-2.4.1.tar.gz -C /usr/local/

配置环境变量 (仅在 hadoop01 上执行)

vim /etc/profile
# 添加以下内容
export HADOOP_HOME=/usr/local/hadoop-2.4.1
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
export HADOOP_COMMON_LIB_NATIVE_DIR=$HADOOP_HOME/lib/native
export HADOOP_OPTS="-Djava.library.path=$HADOOP_HOME/lib"

修改核心配置文件 (仅在 hadoop01 上执行)

cd /usr/local/hadoop-2.4.1/etc/hadoop到该目录,vim hadoop-env.sh,修改JAVA_HOME

export JAVA_HOME=/usr/local/jdk1.7.0_80

core-site.xml: 配置文件系统和临时目录
<property>
  <name>fs.defaultFS</name>
  <value>hdfs://hadoop01:9000</value>
</property>
<property>
  <name>hadoop.tmp.dir</name>
  <value>/tmp/hadoop01</value>
</property>

hdfs-site.xml: 配置副本数和 SecondaryNameNode
<property>
  <name>dfs.replication</name>
  <value>3</value>
</property>
<property>
  <name>dfs.namenode.secondary.http-address</name>
  <value>hadoop02:50090</value>
</property>

mapred-site.xml: 配置 MapReduce 框架(因为系统没有该文件,所以需要先复制,如下)
cp mapred-site.xml.template mapred-site.xml  # 复制模板文件

<property>
  <name>mapreduce.framework.name</name>
  <value>yarn</value>
</property>

yarn-site.xml: 配置 YARN 资源管理
<property>
  <name>yarn.resourcemanager.hostname</name>
  <value>hadoop01</value>
</property>
<property>
  <name>yarn.nodemanager.aux-services</name>
  <value>mapreduce_shuffle</value>
</property>

slaves: 配置从节点列表
hadoop01
hadoop02
hadoop03

同步配置到所有节点 (仅在 hadoop01 上执行)

# 同步环境变量
scp /etc/profile hadoop02:/etc/profile
scp /etc/profile hadoop03:/etc/profile

# 同步 Hadoop 安装目录
scp -r /usr/local/hadoop-2.4.1 hadoop02:/usr/local/
scp -r /usr/local/hadoop-2.4.1 hadoop03:/usr/local/

在所有节点上刷新配置

source /etc/profile

2. 启动与测试集群

关闭防火墙 (所有节点执行)

service firewalld stop
systemctl disable firewalld.service

格式化 HDFS (仅在 hadoop01 上执行,首次启动时执行一次)

hdfs namenode -format

启动集群 (仅在 hadoop01 上执行)

/usr/local/hadoop-2.8.5/sbin/start-dfs.sh
/usr/local/hadoop-2.8.5/sbin/start-yarn.sh

验证集群状态

  • hadoop01 上执行 jps,应显示 NameNode, ResourceManager 等进程
  • hadoop02 和 hadoop03 上执行 jps,应显示 DataNode, NodeManager 等进程

3. 后续建议

  1. 运行测试任务:执行 Hadoop 自带的 wordcount 示例程序验证集群功能
  2. 配置进程管理:将 Hadoop 启动脚本设为系统服务,实现开机自启
  3. 安装管理工具:考虑使用 Ambari 等工具方便集群监控和管理

需要详细说明如何执行 WordCount 测试任务吗?我可以提供从准备输入文件到查看结果的完整流程。

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐