windows安装hadoop3

老刘

Windows 安装 Hadoop 3:从零开始的完整教程

目标关键词:Windows 安装 Hadoop 3

很多人一听到 Hadoop,第一反应就是“这不是大数据服务器才用的吗?Windows 也能装吗?”答案是:能装,而且可以在 Windows 上完成单机开发、学习和调试。如果你只是想先把 Hadoop 3 跑起来,做本地实验、写 MapReduce 程序、熟悉环境,那么在 Windows 上安装完全够用。
这篇文章就按新手也能照着做的方式,带你一步一步把 Hadoop 3 在 Windows 上装好、配好、跑起来。


一、先搞清楚:Windows 上装 Hadoop 3 是干什么用的

Hadoop 是一套分布式大数据框架,核心包括:

  • HDFS:分布式文件系统
  • MapReduce:分布式计算框架
  • YARN:资源调度管理

在 Windows 上安装 Hadoop 3,常见用途有三种:

  1. 学习 Hadoop 基础概念
  2. 在本地测试 Java 程序
  3. 为后续迁移到 Linux 服务器做准备

但也要先说清楚:
Windows 更适合学习和单机调试,不适合长期当正式生产环境。
如果以后要做真正的大数据集群,通常还是建议 Linux。


二、安装前准备:先把环境配齐

安装 Hadoop 3 之前,建议先准备下面这些东西:

1)系统要求

  • Windows 10 / Windows 11 都可以
  • 建议 64 位系统
  • 内存最好 8GB 以上,16GB 更舒服

2)需要安装的软件

  • JDK 8 或 JDK 11
  • Hadoop 3.x
  • WinRAR 或 7-Zip
  • 文本编辑器:记事本、Notepad++、VS Code 都行

3)建议准备一个固定路径

比如:

  • C:\Java\jdk1.8.0_***
  • C:\Hadoop\hadoop-3.3.6

不要把这些目录放到中文路径、空格特别多的路径里,后面少很多坑。


三、第一步:安装 JDK

Hadoop 3 依赖 Java 环境,没有 JDK 是跑不起来的。

1)下载安装 JDK

建议用 JDK 8,兼容性最稳。
如果你装 JDK 11,也可以,但新手建议先用 JDK 8,少折腾。

安装完成后,假设路径是:

C:\Java\jdk1.8.0_202

2)配置环境变量

打开:

此电脑 → 右键属性 → 高级系统设置 → 环境变量

新增或修改以下内容:

新建系统变量

变量名:

JAVA_HOME

变量值:

C:\Java\jdk1.8.0_202

修改 Path

在系统变量 Path 里添加:

%JAVA_HOME%\bin
%JAVA_HOME%\jre\bin

新建变量 CLASSPATH

变量名:

CLASSPATH

变量值:

.;%JAVA_HOME%\lib;%JAVA_HOME%\lib\tools.jar

说明:如果你用的是较新的 JDK,tools.jar 可能不存在,这时候可以不配这个变量,主要保留 JAVA_HOMEPath 就够了。

3)验证 Java 是否成功

Win + R,输入 cmd,然后执行:

java -version

如果看到类似下面的信息,说明成功了:

java version "1.8.0_202"

再执行:

javac -version

能输出版本号就说明 JDK 配置没问题。


四、第二步:下载 Hadoop 3

1)选择版本

建议直接用较稳定的 Hadoop 3.x 版本,比如:

  • Hadoop 3.3.6
  • Hadoop 3.3.4

新手建议选较新的稳定版,不要随便追最新测试版。

2)下载方式

你可以从 Apache Hadoop 官方发布页下载压缩包。
下载后一般是一个 .tar.gz 文件。

比如:

hadoop-3.3.6.tar.gz

3)解压到指定目录

建议解压到:

C:\Hadoop\hadoop-3.3.6

注意:

  • 不要放桌面
  • 不要放中文目录
  • 不要路径太深

五、第三步:Windows 上 Hadoop 3 必须补齐的本地运行文件

这一点是很多新手最容易卡住的地方。

Hadoop 在 Linux 上能直接跑,但在 Windows 上,某些二进制文件需要自己补齐,否则会报错,比如:

  • winutils.exe
  • hadoop.dll

1)准备 winutils.exe

你需要找到与 Hadoop 版本尽量匹配的 winutils.exe
通常放到:

C:\Hadoop\hadoop-3.3.6\bin

2)准备 hadoop.dll

同样放到:

C:\Hadoop\hadoop-3.3.6\bin

3)为什么要这两个文件

因为 Hadoop 在 Windows 下会调用一些本地函数,如果缺少它们,就容易出现:

  • Could not locate executable winutils.exe
  • HADOOP_HOME and hadoop.home.dir are unset
  • NativeIO 相关报错

4)设置环境变量

新增系统变量:

HADOOP_HOME=C:\Hadoop\hadoop-3.3.6

再把下面路径加到 Path:

%HADOOP_HOME%\bin

如果你后面还会用到 sbin,也可以先加上:

%HADOOP_HOME%\sbin

六、第四步:配置 Hadoop 3 的核心文件

Hadoop 的配置文件都在这个目录:

C:\Hadoop\hadoop-3.3.6\etc\hadoop

下面几个文件要改:

  • core-site.xml
  • hdfs-site.xml
  • mapred-site.xml
  • yarn-site.xml
  • hadoop-env.cmd

1)配置 hadoop-env.cmd

找到:

C:\Hadoop\hadoop-3.3.6\etc\hadoop\hadoop-env.cmd

用记事本打开,找到 JAVA_HOME 相关位置,改成你的 JDK 路径:

set JAVA_HOME=C:\Java\jdk1.8.0_202

如果你系统里已经配了 JAVA_HOME,这里也可以直接引用,但新手建议写死路径,最稳。


2)配置 core-site.xml

打开 core-site.xml,写入以下内容:

<configuration>
    <property>
        <name>fs.defaultFS</name>
        <value>hdfs://localhost:9000</value>
    </property>
    <property>
        <name>hadoop.tmp.dir</name>
        <value>C:/Hadoop/hadoop-3.3.6/data/tmp</value>
    </property>
</configuration>

作用说明

  • fs.defaultFS:告诉 Hadoop,默认文件系统地址是多少
  • hadoop.tmp.dir:临时文件存放目录

注意:Windows 路径建议用 /,不要总是写反斜杠 \,避免转义问题。


3)配置 hdfs-site.xml

打开 hdfs-site.xml,写入:

<configuration>
    <property>
        <name>dfs.replication</name>
        <value>1</value>
    </property>
    <property>
        <name>dfs.namenode.name.dir</name>
        <value>C:/Hadoop/hadoop-3.3.6/data/namenode</value>
    </property>
    <property>
        <name>dfs.datanode.data.dir</name>
        <value>C:/Hadoop/hadoop-3.3.6/data/datanode</value>
    </property>
</configuration>

作用说明

  • dfs.replication=1:单机环境只保留 1 份副本,适合本地测试
  • namenodedatanode 目录:存储元数据和数据文件

4)配置 mapred-site.xml

先看目录里有没有这个文件:

mapred-site.xml.template

如果有,就复制一份,改名为:

mapred-site.xml

然后编辑内容为:

<configuration>
    <property>
        <name>mapreduce.framework.name</name>
        <value>yarn</value>
    </property>
</configuration>

5)配置 yarn-site.xml

打开 yarn-site.xml,写入:

<configuration>
    <property>
        <name>yarn.nodemanager.aux-services</name>
        <value>mapreduce_shuffle</value>
    </property>
    <property>
        <name>yarn.nodemanager.env-whitelist</name>
        <value>JAVA_HOME,HADOOP_HOME,HADOOP_CONF_DIR,CLASSPATH_PREPEND_DISTCACHE,PATH,USERPROFILE,HADOOP_COMMON_HOME,HADOOP_HDFS_HOME,HADOOP_MAPRED_HOME,HADOOP_YARN_HOME</value>
    </property>
</configuration>

七、第五步:初始化 HDFS

配置好以后,不要急着启动,先做初始化。

1)创建数据目录

手动创建这些目录:

C:\Hadoop\hadoop-3.3.6\data\tmp
C:\Hadoop\hadoop-3.3.6\data\namenode
C:\Hadoop\hadoop-3.3.6\data\datanode

2)格式化 NameNode

以管理员身份打开 cmd,执行:

hdfs namenode -format

如果格式化成功,会看到一串日志,最后提示 successfully formatted 之类的信息。

这一步只需要第一次做。
如果你后面想重装或清数据,再格式化一次即可。


八、第六步:启动 Hadoop

Windows 上启动 Hadoop,通常需要先启动 HDFS,再启动 YARN。

1)启动 HDFS

打开命令行,执行:

start-dfs.cmd

2)启动 YARN

再开一个命令行窗口,执行:

start-yarn.cmd

3)检查进程是否正常

打开任务管理器,看看是否有这些进程:

  • NameNode
  • DataNode
  • SecondaryNameNode
  • ResourceManager
  • NodeManager

只要这些起来了,基本说明 Hadoop 运行正常。


九、第七步:验证 Hadoop 是否可用

1)访问网页管理界面

在浏览器打开:

http://localhost:9870

这是 HDFS 的管理页面。

再打开:

http://localhost:8088

这是 YARN 的管理页面。

2)常见正常现象

如果页面能打开,说明:

  • NameNode 正常
  • HDFS 正常
  • YARN 正常

这时候 Hadoop 3 在 Windows 上就算安装成功了。


十、常见报错与解决办法

Windows 上装 Hadoop,最常见的不是“装不上”,而是“差一个小配置就报错”。下面把高频问题一次说清。


问题 1:提示找不到 winutils.exe

报错表现

类似:

Could not locate executable winutils.exe in the Hadoop binaries

解决办法

  1. 确认 winutils.exe 放在:
    C:\Hadoop\hadoop-3.3.6\bin
  2. 检查环境变量:
    HADOOP_HOME=C:\Hadoop\hadoop-3.3.6
  3. Path 中包含:
    %HADOOP_HOME%\bin

问题 2:启动时报 Java 找不到

报错表现

类似:

  • JAVA_HOME is not set
  • JAVA_HOME is incorrectly set

解决办法

  1. 检查系统变量 JAVA_HOME
  2. 确认 hadoop-env.cmd 里的路径正确
  3. 用命令测试:
    echo %JAVA_HOME%
    java -version

问题 3:NameNode 格式化失败

可能原因

  • 路径权限不足
  • 数据目录没创建
  • 配置文件写错
  • JDK 路径不对

解决办法

  1. 确认目录存在
  2. 以管理员身份打开 CMD
  3. 检查 XML 是否闭合正确
  4. 删除 data 目录后重新创建,再格式化

问题 4:8088 或 9870 页面打不开

可能原因

  • HDFS/YARN 没启动
  • 防火墙拦截
  • 端口冲突

解决办法

  1. 先看进程是否存在
  2. 重新执行:
    start-dfs.cmd
    start-yarn.cmd
  3. 临时关闭防火墙测试
  4. 检查是否有别的软件占用了端口

问题 5:命令窗口一闪而过

可能原因

  • 批处理脚本执行报错
  • Java 环境没配好
  • Hadoop 配置文件有语法错误

解决办法

不要直接双击 .cmd 文件,建议先打开 CMD,再手动输入命令,这样能看清楚报错信息。


十一、推荐的单机开发方式:伪分布式模式

如果你只是学习 Hadoop,建议先用伪分布式,也就是:

  • 只在一台 Windows 电脑上跑
  • HDFS、YARN、MapReduce 都模拟成集群形式
  • 方便调试,学习成本低

这种模式非常适合:

  • Java 初学者
  • 大数据入门
  • 学校实验环境
  • 面试前快速熟悉 Hadoop

十二、如果你只是想快速跑起来,按这个最简流程做

如果不想看前面那么多细节,直接记住这个顺序:

  1. 安装 JDK 8
  2. 配置 JAVA_HOME
  3. 下载并解压 Hadoop 3
  4. 准备 winutils.exehadoop.dll
  5. 配置 HADOOP_HOME
  6. 修改 core-site.xml
  7. 修改 hdfs-site.xml
  8. 修改 mapred-site.xml
  9. 修改 yarn-site.xml
  10. 设置 hadoop-env.cmdJAVA_HOME
  11. 创建 data 目录
  12. 执行:
    hdfs namenode -format
  13. 执行:
    start-dfs.cmd
    start-yarn.cmd
  14. 打开:
    • http://localhost:9870
    • http://localhost:8088

十三、进阶建议:让 Windows 下的 Hadoop 更稳

1)尽量使用英文路径

比如:

C:\Hadoop\
C:\Java\

不要用:

C:\用户\张三\桌面\Hadoop\

路径越复杂,报错概率越高。

2)尽量用管理员权限运行

尤其是:

  • 格式化 NameNode
  • 启动服务
  • 修改系统环境变量

3)版本尽量匹配

Hadoop 版本、JDK 版本、winutils.exe 尽量不要乱配。

4)别一上来就装太多东西

先把单机 Hadoop 跑起来,再考虑:

  • Hive
  • Spark
  • HBase
  • Sqoop
  • Kafka

一步一步来,最稳。


十四、总结:Windows 安装 Hadoop 3 的核心要点

Windows 上安装 Hadoop 3,本质上就是把下面几件事做好:

  • JDK 配好
  • Hadoop 解压好
  • winutils.exe 补齐
  • 环境变量设置正确
  • XML 配置文件改对
  • NameNode 正确格式化
  • HDFS 和 YARN 能正常启动

只要这些步骤没问题,Hadoop 3 在 Windows 上完全可以稳定运行,用来学习和开发绰绰有余。

最容易出错的地方,通常集中在这三类:

  1. Java 环境没配好
  2. HADOOP_HOME 和 Path 有问题
  3. XML 配置写错或路径不对

把这三个点检查一遍,大多数问题都能解决。

文章版权声明:文章内容均来源于各大短视频平台搜集以及修改和删减新增,如有侵权或者违规,请联系站长进行删除,如需转载或复制请以超链接形式并注明出处。

发表评论

快捷回复: 表情:
AddoilApplauseBadlaughBombCoffeeFabulousFacepalmFecesFrownHeyhaInsidiousKeepFightingNoProbPigHeadShockedSinistersmileSlapSocialSweatTolaughWatermelonWittyWowYeahYellowdog
验证码
评论列表 (暂无评论,1人围观)

还没有评论,来说两句吧...

目录[+]