各厂语言模型

华为开源5050亿参数盘古2.0 Pro:昇腾原生训练的国产最大MoE语言模型

2026年8月2日0 次阅读
华为开源5050亿参数盘古2.0 Pro:昇腾原生训练的国产最大MoE语言模型

7月31日,华为正式开源 openPangu-2.0-Pro 大语言模型,同步发布模型权重、基础推理代码及技术报告。这是华为 openPangu 2.0 开源计划的核心版本,也是目前国产开源模型中参数规模最大的 MoE 语言模型之一。

核心参数一览

openPangu-2.0-Pro 采用 Mixture of Experts(MoE)架构,总参数约 5050 亿(505B),每个 token 激活约 180 亿(18B)参数,支持 512K 超长上下文窗口,训练数据规模约 34T tokens。最关键的一点:整个模型从预训练到后训练全部基于华为昇腾 NPU 完成,没有依赖英伟达 GPU。

后训练:快慢融合 + 多专项RL + 在线蒸馏

在后训练阶段,openPangu-2.0-Pro 采用了三阶段策略:

  • 快慢融合 SFT:将快速响应与深度推理两种能力通过监督微调融合到同一模型
  • 多专项强化学习:针对不同能力维度分别进行 RL 训练
  • 在线蒸馏(OPD):通过在线蒸馏实现多能力融合,进一步提升综合表现

这种"分项强化 + 蒸馏融合"的思路,和 DeepSeek 系列的后训练路线有相似之处,但昇腾原生实现是独特差异点。

昇腾原生:不只是"换个芯片跑"

余承东在 HDC 2026 上曾表示,华为会投入大量 AI 算力支持国产产业生态,但可用算力相对有限、训练成本持续高企,因此华为更注重模型在延迟和吞吐上的效率优化。openPangu-2.0-Pro 的 18B 激活参数设计正是这种思路的体现——用更少的激活参数实现更强的能力,降低推理成本。

openPangu 2.0 开源路线图

openPangu 2.0 的开源是分步推进的:

  • 6月30日:先发布 92B 参数的 openPangu-2.0-Flash
  • 7月31日:发布 505B 的 openPangu-2.0-Pro(本次)
  • 后续:还将开源预训练代码、后训练代码、训练算子等共 7 大组件

模型权重和推理代码已发布在华为云 ModelArts Studio 的昇腾部落开源社区。

对谁有用

  • 国产大模型开发者:505B MoE 是目前可用的最大国产开源语言模型之一
  • 昇腾生态开发者:提供了昇腾 NPU 全流程训练的最佳实践参考
  • MoE 研究者:18B 激活 / 505B 总参数的配比和后训练策略值得对比研究

---

*基于 aibase、东方财富、AI Weekly 等多家媒体转述整理*

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...