华为开源5050亿参数盘古2.0 Pro:昇腾原生训练的国产最大MoE语言模型
2026年8月2日0 次阅读
华为开源5050亿参数盘古2.0 Pro:昇腾原生训练的国产最大MoE语言模型
7月31日,华为正式开源 openPangu-2.0-Pro 大语言模型,同步发布模型权重、基础推理代码及技术报告。这是华为 openPangu 2.0 开源计划的核心版本,也是目前国产开源模型中参数规模最大的 MoE 语言模型之一。
核心参数一览
openPangu-2.0-Pro 采用 Mixture of Experts(MoE)架构,总参数约 5050 亿(505B),每个 token 激活约 180 亿(18B)参数,支持 512K 超长上下文窗口,训练数据规模约 34T tokens。最关键的一点:整个模型从预训练到后训练全部基于华为昇腾 NPU 完成,没有依赖英伟达 GPU。
后训练:快慢融合 + 多专项RL + 在线蒸馏
在后训练阶段,openPangu-2.0-Pro 采用了三阶段策略:
- 快慢融合 SFT:将快速响应与深度推理两种能力通过监督微调融合到同一模型
- 多专项强化学习:针对不同能力维度分别进行 RL 训练
- 在线蒸馏(OPD):通过在线蒸馏实现多能力融合,进一步提升综合表现
这种"分项强化 + 蒸馏融合"的思路,和 DeepSeek 系列的后训练路线有相似之处,但昇腾原生实现是独特差异点。
昇腾原生:不只是"换个芯片跑"
余承东在 HDC 2026 上曾表示,华为会投入大量 AI 算力支持国产产业生态,但可用算力相对有限、训练成本持续高企,因此华为更注重模型在延迟和吞吐上的效率优化。openPangu-2.0-Pro 的 18B 激活参数设计正是这种思路的体现——用更少的激活参数实现更强的能力,降低推理成本。
openPangu 2.0 开源路线图
openPangu 2.0 的开源是分步推进的:
- 6月30日:先发布 92B 参数的 openPangu-2.0-Flash
- 7月31日:发布 505B 的 openPangu-2.0-Pro(本次)
- 后续:还将开源预训练代码、后训练代码、训练算子等共 7 大组件
模型权重和推理代码已发布在华为云 ModelArts Studio 的昇腾部落开源社区。
对谁有用
- 国产大模型开发者:505B MoE 是目前可用的最大国产开源语言模型之一
- 昇腾生态开发者:提供了昇腾 NPU 全流程训练的最佳实践参考
- MoE 研究者:18B 激活 / 505B 总参数的配比和后训练策略值得对比研究
---
*基于 aibase、东方财富、AI Weekly 等多家媒体转述整理*