Windows 安装 Hadoop 3:从零开始的完整教程
目标关键词:Windows 安装 Hadoop 3
很多人一听到 Hadoop,第一反应就是“这不是大数据服务器才用的吗?Windows 也能装吗?”答案是:能装,而且可以在 Windows 上完成单机开发、学习和调试。如果你只是想先把 Hadoop 3 跑起来,做本地实验、写 MapReduce 程序、熟悉环境,那么在 Windows 上安装完全够用。
这篇文章就按新手也能照着做的方式,带你一步一步把 Hadoop 3 在 Windows 上装好、配好、跑起来。
一、先搞清楚:Windows 上装 Hadoop 3 是干什么用的
Hadoop 是一套分布式大数据框架,核心包括:
- HDFS:分布式文件系统
- MapReduce:分布式计算框架
- YARN:资源调度管理
在 Windows 上安装 Hadoop 3,常见用途有三种:
- 学习 Hadoop 基础概念
- 在本地测试 Java 程序
- 为后续迁移到 Linux 服务器做准备
但也要先说清楚:
Windows 更适合学习和单机调试,不适合长期当正式生产环境。
如果以后要做真正的大数据集群,通常还是建议 Linux。
二、安装前准备:先把环境配齐
安装 Hadoop 3 之前,建议先准备下面这些东西:
1)系统要求
- Windows 10 / Windows 11 都可以
- 建议 64 位系统
- 内存最好 8GB 以上,16GB 更舒服
2)需要安装的软件
- JDK 8 或 JDK 11
- Hadoop 3.x
- WinRAR 或 7-Zip
- 文本编辑器:记事本、Notepad++、VS Code 都行
3)建议准备一个固定路径
比如:
C:\Java\jdk1.8.0_***C:\Hadoop\hadoop-3.3.6
不要把这些目录放到中文路径、空格特别多的路径里,后面少很多坑。
三、第一步:安装 JDK
Hadoop 3 依赖 Java 环境,没有 JDK 是跑不起来的。
1)下载安装 JDK
建议用 JDK 8,兼容性最稳。
如果你装 JDK 11,也可以,但新手建议先用 JDK 8,少折腾。
安装完成后,假设路径是:
C:\Java\jdk1.8.0_202
2)配置环境变量
打开:
此电脑 → 右键属性 → 高级系统设置 → 环境变量
新增或修改以下内容:
新建系统变量
变量名:
JAVA_HOME
变量值:
C:\Java\jdk1.8.0_202
修改 Path
在系统变量 Path 里添加:
%JAVA_HOME%\bin
%JAVA_HOME%\jre\bin
新建变量 CLASSPATH
变量名:
CLASSPATH
变量值:
.;%JAVA_HOME%\lib;%JAVA_HOME%\lib\tools.jar
说明:如果你用的是较新的 JDK,
tools.jar可能不存在,这时候可以不配这个变量,主要保留JAVA_HOME和Path就够了。
3)验证 Java 是否成功
按 Win + R,输入 cmd,然后执行:
java -version
如果看到类似下面的信息,说明成功了:
java version "1.8.0_202"
再执行:
javac -version
能输出版本号就说明 JDK 配置没问题。
四、第二步:下载 Hadoop 3
1)选择版本
建议直接用较稳定的 Hadoop 3.x 版本,比如:
- Hadoop 3.3.6
- Hadoop 3.3.4
新手建议选较新的稳定版,不要随便追最新测试版。
2)下载方式
你可以从 Apache Hadoop 官方发布页下载压缩包。
下载后一般是一个 .tar.gz 文件。
比如:
hadoop-3.3.6.tar.gz
3)解压到指定目录
建议解压到:
C:\Hadoop\hadoop-3.3.6
注意:
- 不要放桌面
- 不要放中文目录
- 不要路径太深
五、第三步:Windows 上 Hadoop 3 必须补齐的本地运行文件
这一点是很多新手最容易卡住的地方。
Hadoop 在 Linux 上能直接跑,但在 Windows 上,某些二进制文件需要自己补齐,否则会报错,比如:
winutils.exehadoop.dll
1)准备 winutils.exe
你需要找到与 Hadoop 版本尽量匹配的 winutils.exe。
通常放到:
C:\Hadoop\hadoop-3.3.6\bin
2)准备 hadoop.dll
同样放到:
C:\Hadoop\hadoop-3.3.6\bin
3)为什么要这两个文件
因为 Hadoop 在 Windows 下会调用一些本地函数,如果缺少它们,就容易出现:
Could not locate executable winutils.exeHADOOP_HOME and hadoop.home.dir are unsetNativeIO相关报错
4)设置环境变量
新增系统变量:
HADOOP_HOME=C:\Hadoop\hadoop-3.3.6
再把下面路径加到 Path:
%HADOOP_HOME%\bin
如果你后面还会用到 sbin,也可以先加上:
%HADOOP_HOME%\sbin
六、第四步:配置 Hadoop 3 的核心文件
Hadoop 的配置文件都在这个目录:
C:\Hadoop\hadoop-3.3.6\etc\hadoop
下面几个文件要改:
core-site.xmlhdfs-site.xmlmapred-site.xmlyarn-site.xmlhadoop-env.cmd
1)配置 hadoop-env.cmd
找到:
C:\Hadoop\hadoop-3.3.6\etc\hadoop\hadoop-env.cmd
用记事本打开,找到 JAVA_HOME 相关位置,改成你的 JDK 路径:
set JAVA_HOME=C:\Java\jdk1.8.0_202
如果你系统里已经配了 JAVA_HOME,这里也可以直接引用,但新手建议写死路径,最稳。
2)配置 core-site.xml
打开 core-site.xml,写入以下内容:
<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://localhost:9000</value>
</property>
<property>
<name>hadoop.tmp.dir</name>
<value>C:/Hadoop/hadoop-3.3.6/data/tmp</value>
</property>
</configuration>
作用说明
fs.defaultFS:告诉 Hadoop,默认文件系统地址是多少hadoop.tmp.dir:临时文件存放目录
注意:Windows 路径建议用
/,不要总是写反斜杠\,避免转义问题。
3)配置 hdfs-site.xml
打开 hdfs-site.xml,写入:
<configuration>
<property>
<name>dfs.replication</name>
<value>1</value>
</property>
<property>
<name>dfs.namenode.name.dir</name>
<value>C:/Hadoop/hadoop-3.3.6/data/namenode</value>
</property>
<property>
<name>dfs.datanode.data.dir</name>
<value>C:/Hadoop/hadoop-3.3.6/data/datanode</value>
</property>
</configuration>
作用说明
dfs.replication=1:单机环境只保留 1 份副本,适合本地测试namenode和datanode目录:存储元数据和数据文件
4)配置 mapred-site.xml
先看目录里有没有这个文件:
mapred-site.xml.template
如果有,就复制一份,改名为:
mapred-site.xml
然后编辑内容为:
<configuration>
<property>
<name>mapreduce.framework.name</name>
<value>yarn</value>
</property>
</configuration>
5)配置 yarn-site.xml
打开 yarn-site.xml,写入:
<configuration>
<property>
<name>yarn.nodemanager.aux-services</name>
<value>mapreduce_shuffle</value>
</property>
<property>
<name>yarn.nodemanager.env-whitelist</name>
<value>JAVA_HOME,HADOOP_HOME,HADOOP_CONF_DIR,CLASSPATH_PREPEND_DISTCACHE,PATH,USERPROFILE,HADOOP_COMMON_HOME,HADOOP_HDFS_HOME,HADOOP_MAPRED_HOME,HADOOP_YARN_HOME</value>
</property>
</configuration>
七、第五步:初始化 HDFS
配置好以后,不要急着启动,先做初始化。
1)创建数据目录
手动创建这些目录:
C:\Hadoop\hadoop-3.3.6\data\tmp
C:\Hadoop\hadoop-3.3.6\data\namenode
C:\Hadoop\hadoop-3.3.6\data\datanode
2)格式化 NameNode
以管理员身份打开 cmd,执行:
hdfs namenode -format
如果格式化成功,会看到一串日志,最后提示 successfully formatted 之类的信息。
这一步只需要第一次做。
如果你后面想重装或清数据,再格式化一次即可。
八、第六步:启动 Hadoop
Windows 上启动 Hadoop,通常需要先启动 HDFS,再启动 YARN。
1)启动 HDFS
打开命令行,执行:
start-dfs.cmd
2)启动 YARN
再开一个命令行窗口,执行:
start-yarn.cmd
3)检查进程是否正常
打开任务管理器,看看是否有这些进程:
NameNodeDataNodeSecondaryNameNodeResourceManagerNodeManager
只要这些起来了,基本说明 Hadoop 运行正常。
九、第七步:验证 Hadoop 是否可用
1)访问网页管理界面
在浏览器打开:
http://localhost:9870
这是 HDFS 的管理页面。
再打开:
http://localhost:8088
这是 YARN 的管理页面。
2)常见正常现象
如果页面能打开,说明:
- NameNode 正常
- HDFS 正常
- YARN 正常
这时候 Hadoop 3 在 Windows 上就算安装成功了。
十、常见报错与解决办法
Windows 上装 Hadoop,最常见的不是“装不上”,而是“差一个小配置就报错”。下面把高频问题一次说清。
问题 1:提示找不到 winutils.exe
报错表现
类似:
Could not locate executable winutils.exe in the Hadoop binaries
解决办法
- 确认
winutils.exe放在:C:\Hadoop\hadoop-3.3.6\bin - 检查环境变量:
HADOOP_HOME=C:\Hadoop\hadoop-3.3.6 - Path 中包含:
%HADOOP_HOME%\bin
问题 2:启动时报 Java 找不到
报错表现
类似:
JAVA_HOME is not setJAVA_HOME is incorrectly set
解决办法
- 检查系统变量
JAVA_HOME - 确认
hadoop-env.cmd里的路径正确 - 用命令测试:
echo %JAVA_HOME% java -version
问题 3:NameNode 格式化失败
可能原因
- 路径权限不足
- 数据目录没创建
- 配置文件写错
- JDK 路径不对
解决办法
- 确认目录存在
- 以管理员身份打开 CMD
- 检查 XML 是否闭合正确
- 删除
data目录后重新创建,再格式化
问题 4:8088 或 9870 页面打不开
可能原因
- HDFS/YARN 没启动
- 防火墙拦截
- 端口冲突
解决办法
- 先看进程是否存在
- 重新执行:
start-dfs.cmd start-yarn.cmd - 临时关闭防火墙测试
- 检查是否有别的软件占用了端口
问题 5:命令窗口一闪而过
可能原因
- 批处理脚本执行报错
- Java 环境没配好
- Hadoop 配置文件有语法错误
解决办法
不要直接双击 .cmd 文件,建议先打开 CMD,再手动输入命令,这样能看清楚报错信息。
十一、推荐的单机开发方式:伪分布式模式
如果你只是学习 Hadoop,建议先用伪分布式,也就是:
- 只在一台 Windows 电脑上跑
- HDFS、YARN、MapReduce 都模拟成集群形式
- 方便调试,学习成本低
这种模式非常适合:
- Java 初学者
- 大数据入门
- 学校实验环境
- 面试前快速熟悉 Hadoop
十二、如果你只是想快速跑起来,按这个最简流程做
如果不想看前面那么多细节,直接记住这个顺序:
- 安装 JDK 8
- 配置
JAVA_HOME - 下载并解压 Hadoop 3
- 准备
winutils.exe和hadoop.dll - 配置
HADOOP_HOME - 修改
core-site.xml - 修改
hdfs-site.xml - 修改
mapred-site.xml - 修改
yarn-site.xml - 设置
hadoop-env.cmd的JAVA_HOME - 创建
data目录 - 执行:
hdfs namenode -format - 执行:
start-dfs.cmd start-yarn.cmd - 打开:
http://localhost:9870http://localhost:8088
十三、进阶建议:让 Windows 下的 Hadoop 更稳
1)尽量使用英文路径
比如:
C:\Hadoop\
C:\Java\
不要用:
C:\用户\张三\桌面\Hadoop\
路径越复杂,报错概率越高。
2)尽量用管理员权限运行
尤其是:
- 格式化 NameNode
- 启动服务
- 修改系统环境变量
3)版本尽量匹配
Hadoop 版本、JDK 版本、winutils.exe 尽量不要乱配。
4)别一上来就装太多东西
先把单机 Hadoop 跑起来,再考虑:
- Hive
- Spark
- HBase
- Sqoop
- Kafka
一步一步来,最稳。
十四、总结:Windows 安装 Hadoop 3 的核心要点
Windows 上安装 Hadoop 3,本质上就是把下面几件事做好:
- JDK 配好
- Hadoop 解压好
- winutils.exe 补齐
- 环境变量设置正确
- XML 配置文件改对
- NameNode 正确格式化
- HDFS 和 YARN 能正常启动
只要这些步骤没问题,Hadoop 3 在 Windows 上完全可以稳定运行,用来学习和开发绰绰有余。
最容易出错的地方,通常集中在这三类:
- Java 环境没配好
- HADOOP_HOME 和 Path 有问题
- XML 配置写错或路径不对
把这三个点检查一遍,大多数问题都能解决。

还没有评论,来说两句吧...