训练一个万亿级参数的AI大模型,工作量有多大?
想象一下,我现在有一道非常复杂的数学题,每张卡只负责一小块。但不能有人偷懒,不能有人出错,不能有人掉队。而且要连续跑上几天,日夜不停顿才能出来结果。
这类万亿级大模型的高效全参数后训练,此前主要是依靠英伟达的GPU体系,而使用国产算力的非常少。
但是最近,深圳计算机学会牵头联合哈工大深圳、深圳市大数据研究院、华为GTS等团队,最近做了一件大事。

图片来源于网络,版权归原作者所有,侵权请联系删除
用国产芯片完成万亿参数训练
科研团队用国产的昇腾910C芯片集群,在一个月的时间内,把DeepSeek V4 Pro这个1.6万亿参数的巨无霸模型,稳稳地训练了1500多步,一步都没有崩。
为什么这件事值得我们说一说呢?我们先来科普一下背景。
技术背景:MOE模型的训练难度
这个1.6万亿参数的MOE模型,用的是稀疏专家的结构——你可以理解为有很多专家,每一次提问只激活其中的几位专家来回答。听起来非常高效,但后训练起来麻烦大了:
- 专家之间要频繁沟通,通信量是普通模型的几十倍
- 注意力机制还在动态切换模式,对芯片算子的效率极其敏感
- 需要调动大量的显存资源
此前DeepSeek V4 Pro已经在国产算力上做了推理部署。根据团队披露,这是公开可查范围内,第三方机构首次在国产算力集群上完成DeepSeek V4 Pro的全参数后训练。

图片来源于网络,版权归原作者所有,侵权请联系删除
推理vs训练:天壤之别
简单地说,以前只是"能用"——推理只是"走",输入进来、输出出去这么一条路。现在要让大模型"调",后训练走前向加反向多条路:输入输出算一遍,然后要算错在哪里、每个参数怎么调。计算量和通信量都会翻好几倍。
三个硬核突破
这件事做成了,实现了三个硬核突破:
第一,显存拼图——万亿级的大模型不可能只塞进一张卡。团队设计了分布式的存算方案,每张卡放什么、怎么放、整个算力怎么调度,全都算得明明白白。
第二,负载均衡——MOE模型最怕负载不均,有几个专家忙得够呛,其余在闲着。团队这一次专门保证专家分工合理、通信不堵车。
第三,有人守夜——全参数后训练最怕的不是慢,而是跑着跑着系统突然崩了。这次团队搭了完整的监控体系,全部实现可视可控。
一句话总结
国产AI基础设施,正在从推理部署和轻量的微调,转向万卡级MOE模型的全参数后训练。这块硬骨头,可以说我们啃下来了。
我们也期待,未来科学家团队可以以此为基础,继续探索新一代通用人工智能的基础理论、新范式和新架构。
本文内容来源于新华社,版权归原作者所有。如有侵权,请联系删除。
本文仅作科普传播之用,非商业用途。

还没有评论,来说两句吧...