一、环境准备

        在开始安装 Hadoop 之前,确保 CentOS 8 系统已完成以下配置:

  1. 更新系统:
  2. 关闭防火墙:
  3. 禁用 SELinux:

    二、下载 Hadoop
    访问 Apache Hadoop 官方网站,选择适合的版本进行下载,也可以使用以下命令下载 Hadoop 3.3.4 版本:

    解压下载的安装包到/opt目录:

     

  4. 创建软链接方便访问:

    三、配置 Hadoop

  5. 设置环境变量:编辑~/.bashrc文件,添加以下内容:

     
  6. 创建 Hadoop 用户组和用户:
    export HADOOP_HOME=/opt/hadoop
    export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
    export JAVA_HOME=/usr/lib/jvm/java-11-openjdk  # 需提前安装JDK
     
    

    加载环境变量:
     

    source ~/.bashrc
     
    

    配置Hadoop

  7. 修改$HADOOP_HOME/etc/hadoop/hadoop-env.sh
    设置JAVA_HOME路径:
     

    export JAVA_HOME=/usr/lib/jvm/java-11-openjdk
     
    

    核心配置文件(core-site.xml
    添加以下内容:
    <configuration>
        <property>
            <name>fs.defaultFS</name>
            <value>hdfs://localhost:9000</value>
        </property>
    </configuration>
     
    

    HDFS配置文件(hdfs-site.xml
    配置副本数和数据存储路径:
     

    <configuration>
        <property>
            <name>dfs.replication</name>
            <value>1</value>
        </property>
        <property>
            <name>dfs.namenode.name.dir</name>
            <value>/opt/hadoop_data/namenode</value>
        </property>
        <property>
            <name>dfs.datanode.data.dir</name>
            <value>/opt/hadoop_data/datanode</value>
        </property>
    </configuration>
     
    

    YARN配置(yarn-site.xml
     

    <configuration>
        <property>
            <name>yarn.nodemanager.aux-services</name>
            <value>mapreduce_shuffle</value>
        </property>
    </configuration>
     
    

    MapReduce配置(mapred-site.xml
     

    <configuration>
        <property>
            <name>mapreduce.framework.name</name>
            <value>yarn</value>
        </property>
    </configuration>
     
    

    启动Hadoop

  8. 格式化HDFS
    首次启动需格式化NameNode:
     

    hdfs namenode -format
     
    

    启动HDFS和YARN
    start-dfs.sh
    start-yarn.sh
     
    

    验证服务
    检查进程是否运行:
     

    jps
     
    

    预期输出包含:NameNodeDataNodeResourceManagerNodeManager
     

    基本操作示例

  9. 创建HDFS目录
     

    hdfs dfs -mkdir /input
     
    

    上传文件到HDFS
    hdfs dfs -put /path/to/local/file /input
     
    

    运行MapReduce任务
    使用Hadoop自带的WordCount示例:
     

    hadoop jar $HADOOP_HOME/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.6.jar wordcount /input /output
     
    

    查看结果
     

    hdfs dfs -cat /output/*
     
    

    注意事项

  10. 确保SSH免密登录已配置(ssh localhost测试)。
  11. 防火墙需开放端口(9870、8088等)。
  12. 存储路径需提前创建并赋予权限:
    mkdir -p /opt/hadoop_data/{namenode,datanode}
    chown -R $USER:$USER /opt/hadoop_data
     
    

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐