Apache Spark 在 Windows 上的完整安装指南
Apache Spark 是一个强大的分布式计算框架,广泛应用于大数据处理。虽然它原生支持 Linux 环境,但在 Windows 上安装和运行也是完全可行的。本文将手把手教你如何在 Windows 系统中顺利安装并配置 Apache Spark,即使是电脑新手也能轻松跟上。
一、安装前准备工作
在开始安装 Spark 之前,我们需要确保系统环境已经准备就绪。Spark 运行需要 Java 环境支持,所以第一步就是安装 JDK。
1.1 安装 Java 开发工具包(JDK)
-
下载 JDK
- 打开浏览器,访问 Oracle 官网的 Java 下载页面
- 选择 Java 8 或 Java 11(Spark 3.x 版本支持 Java 8/11/17)
- 下载 Windows x64 安装程序
-
安装 JDK
- 双击下载的安装程序,点击“下一步”
- 记住安装路径(默认通常是
C:\Program Files\Java\jdk-版本号\) - 等待安装完成
-

配置环境变量
- 右键点击“此电脑” → 选择“属性” → 点击“高级系统设置”
- 点击“环境变量”按钮
- 在“系统变量”区域,点击“新建”
- 变量名:
JAVA_HOME - 变量值:你的 JDK 安装路径(如
C:\Program Files\Java\jdk-11.0.15)
- 变量名:
- 找到 Path 变量,点击“编辑”
- 点击“新建”,添加
%JAVA_HOME%\bin - 点击“确定”保存所有更改
-
验证 Java 安装
- 按
Win + R打开运行窗口 - 输入
cmd并按回车打开命令提示符 - 输入
java -version并按回车 - 如果显示 Java 版本信息,说明安装成功
- 按
1.2 安装 Scala(可选但推荐)
Spark 是用 Scala 编写的,虽然不强制安装,但安装 Scala 能让后续使用更顺畅。
- 访问 Scala 官网下载页面
- 下载 Windows 安装程序
- 运行安装程序,按提示完成安装
- 同样需要将 Scala 的 bin 目录添加到 Path 环境变量中
二、Apache Spark 安装步骤
2.1 下载 Apache Spark
- 打开 Apache Spark 官方网站的下载页面
- 选择最新稳定版本(目前推荐 Spark 3.x 系列)
- 在“Choose a package type”下拉菜单中选择“Pre-built for Apache Hadoop 3.3 and later”
- 点击下载链接,获取
.tgz压缩文件
2.2 解压和安装 Spark
-
解压文件
- 下载完成后,你会得到一个
.tgz文件 - 使用 7-Zip 或 WinRAR 等解压工具解压文件
- 建议解压到简单路径,如
C:\spark
- 下载完成后,你会得到一个
-
配置环境变量
- 再次打开环境变量设置(方法同上)
- 新建系统变量:
- 变量名:
SPARK_HOME - 变量值:你的 Spark 解压路径(如
C:\spark\spark-3.3.1-bin-hadoop3)
- 变量名:
- 编辑 Path 变量,添加
%SPARK_HOME%\bin
-
验证 Spark 安装
- 打开新的命令提示符窗口
- 输入
spark-shell并按回车 - 如果看到 Spark 标志和 Scala 提示符(
scala>),说明安装成功
三、解决 Windows 特有问题
在 Windows 上运行 Spark 可能会遇到一些特有问题,下面是常见问题及解决方法。
3.1 解决 winutils.exe 错误
Spark 在 Windows 上需要 Hadoop 的 winutils 工具。
-
下载 winutils
- 访问 GitHub 上的 winutils 项目
- 下载与你的 Hadoop 版本匹配的 winutils.exe
- (Spark 预构建包包含 Hadoop 3.3,所以下载 hadoop-3.3.x 版本)
-
配置 winutils
- 创建一个目录,如
C:\hadoop\bin - 将下载的 winutils.exe 复制到这个目录
- 创建环境变量:
- 变量名:
HADOOP_HOME - 变量值:
C:\hadoop
- 变量名:
- 将
%HADOOP_HOME%\bin添加到 Path 变量
- 创建一个目录,如
-
设置权限
- 以管理员身份打开命令提示符
- 输入以下命令:
winutils.exe chmod 777 C:\tmp\hive - 如果目录不存在,先创建它
3.2 处理内存不足问题
如果启动 spark-shell 时出现内存错误:
-
创建配置文件
- 进入
%SPARK_HOME%\conf目录 - 复制
spark-env.sh.template文件,重命名为spark-env.sh
- 进入
-
编辑配置文件
- 用记事本或文本编辑器打开
spark-env.sh - 添加以下内容:
export SPARK_DRIVER_MEMORY=2g export SPARK_EXECUTOR_MEMORY=2g - 根据你的电脑内存调整数值(8GB 内存建议设为 2g,16GB 可设为 4g)
- 用记事本或文本编辑器打开
四、测试 Spark 安装
4.1 基本功能测试
-
启动 Spark Shell
spark-shell -
运行简单测试 在 Scala 提示符下输入:
val data = Array(1, 2, 3, 4, 5) val distData = sc.parallelize(data) distData.collect()应该看到输出:
Array[Int] = Array(1, 2, 3, 4, 5)
4.2 读写文件测试
-
创建测试文件
- 在桌面新建文本文档,命名为
test.txt - 输入几行文字,每行一个单词
- 保存文件
- 在桌面新建文本文档,命名为
-
在 Spark 中读取文件
val textFile = spark.read.textFile("C:/Users/你的用户名/Desktop/test.txt") textFile.count()这会显示文件中的行数
五、安装 PySpark(Python 接口)
如果你想使用 Python 操作 Spark,需要安装 PySpark。
5.1 安装 Python
- 访问 Python 官网下载页面
- 下载 Windows 安装程序(推荐 Python 3.8+)
- 安装时务必勾选“Add Python to PATH”
5.2 安装 PySpark
-
使用 pip 安装
pip install pyspark -
验证 PySpark 安装
python在 Python 交互环境中输入:
from pyspark.sql import SparkSession spark = SparkSession.builder.appName("test").getOrCreate() print(spark)
六、优化和进阶配置
6.1 提高 Spark 在 Windows 上的性能
-
调整日志级别
- 复制
%SPARK_HOME%\conf\log4j2.properties.template - 重命名为
log4j2.properties - 将
rootLogger.level = info改为rootLogger.level = error - 减少日志输出,提高速度
- 复制
-
使用本地模式优化 在启动 spark-shell 时添加参数:
spark-shell --master local[4]数字 4 表示使用 4 个线程,可根据 CPU 核心数调整
6.2 集成开发环境配置
-
IntelliJ IDEA 配置
- 安装 Scala 插件
- 新建项目时选择 SBT 项目
- 在 build.sbt 中添加 Spark 依赖
-
Jupyter Notebook 配置
pip install jupyter findspark在 Notebook 中:
import findspark findspark.init() import pyspark
七、常见问题排错指南
问题1:启动 spark-shell 时报错“不是内部或外部命令”
解决方法:环境变量配置不正确。检查 SPARK_HOME 和 Path 设置,确保路径正确无误。
问题2:出现 java.io.IOException: Could not locate executable null\bin\winutils.exe
解决方法:HADOOP_HOME 环境变量未设置或设置错误。确保正确设置了 HADOOP_HOME 并指向包含 winutils.exe 的目录。
问题3:内存溢出错误
解决方法:调整 spark-env.sh 中的内存设置,或启动时指定内存大小:
spark-shell --driver-memory 4g
问题4:端口冲突错误
解决方法:Spark 默认使用 4040 端口,如果被占用可以:
spark-shell --conf spark.ui.port=4041
八、维护和升级建议
-
定期清理
- Spark 会在本地保存临时文件,定期清理
C:\tmp\spark-*目录 - 检查日志文件,删除旧的日志释放空间
- Spark 会在本地保存临时文件,定期清理
-
备份配置
- 将修改过的配置文件备份到安全位置
- 记录所有环境变量设置
-
升级 Spark
- 下载新版本 Spark
- 解压到新目录
- 更新 SPARK_HOME 环境变量
- 复制旧的配置文件到新版本
总结
在 Windows 上安装 Apache Spark 虽然需要一些额外配置,但按照上述步骤操作,完全可以在 Windows 环境下搭建起完整的 Spark 开发平台。关键步骤包括:安装 Java、下载解压 Spark、配置环境变量、解决 winutils 问题。完成这些后,你就可以在 Windows 上体验 Spark 的强大数据处理能力了。
对于初学者,建议从 spark-shell 开始,熟悉基本操作后再尝试编写完整的 Spark 应用程序。随着熟练度提高,可以进一步探索 Spark 的集群部署和性能调优。
如果在安装过程中遇到本文未覆盖的问题,可以查看 Spark 日志文件获取详细错误信息,通常位于 %SPARK_HOME%\logs 目录下。大多数问题都可以通过仔细检查环境变量配置和文件权限来解决。

还没有评论,来说两句吧...