华为 openPangu-2.0 训练与 RL 代码开源

华为于 2026 年 9 月 28 日宣布开源 openPangu-2.0 的预训练、SFT 代码与后训练 RL 代码,训练框架与昇腾原生强化学习框架同步上线 Ascend Tribe 开源社区。

这次发布的是什么

华为于 2026 年 9 月 28 日宣布,开源盘古 openPangu-2.0 的预训练、SFT 代码和后训练 RL 代码正式开源上线。发布地点标注为中国深圳。

开源盘古 openPangu 是华为的开源 AI 模型品牌,官方对它的定位是「通过昇腾原生训练与推理技术,为业界用好昇腾提供参考」,目标是给 Agent 时代的智能底座提供一套可参照的工程样板。需要说清的是,这次开源的不是一个新的模型权重,而是训练侧的两套代码:一套负责预训练与监督微调,一套负责后训练的强化学习。

官方称 openPangu-2.0 的模型相关组件已陆续上线开源平台,更多开源信息指向 Ascend Tribe 开源社区。

可用性与限制

  • 开源内容:预训练与 SFT 代码(openPangu-2.0-Training)、后训练 RL 代码(openPangu-2.0-RL),本次公告未涉及新权重发布。
  • 硬件前提:RL 框架官方明确「面向华为昇腾」,训练框架描述为百亿至万亿参数级基础模型训练基础设施,个人单机难以复现。
  • 获取渠道:官方公告指向 Ascend Tribe 开源社区,未逐项列出每个组件的具体仓库地址,实际仓库以开源社区为准。
  • 许可协议:本次公告未写明开源协议条款,商用前请以开源仓库中的许可文件为准。
  • 上手门槛:定位是训练框架而非开箱即用的产品,需要分布式训练与集群运维经验。
  • 适用范围:官方给的场景是复杂任务中的自主规划与执行能力提升,属于后训练环节,不是推理部署工具。

主要功能

  • 支持大规模预训练与持续训练
  • 提供监督微调与指令对齐能力
  • 支持多维分布式并行策略
  • 提供高效数据流水线处理
  • 支持混合精度与自定义算子优化
  • 提供昇腾原生的强化学习后训练

技术原理

据官方 FAQ,两套代码的职责是分开的。

openPangu-2.0-Training 是面向大规模基础模型训练的统一训练框架,覆盖从大规模预训练、监督微调到模型持续优化的一体化能力。官方列出的支撑项包括多维分布式并行、高效数据流水线、混合精度训练、自定义算子优化以及高可用训练,目标参数规模区间为百亿至万亿级基础模型。

openPangu-2.0-RL 是面向昇腾的强化学习加速框架。官方说明它基于 VERL 生态构建昇腾原生的 RL 训练与部署能力,支持高精度、高效的 Agentic RL 后训练,用于提升模型在复杂任务中自主规划与执行的能力。

本次公告未披露更细的训练超参、数据配比与算法清单。网络上流传的一些算法名与具体参数规模并非出自这份公告,本稿不予采信,请以开源仓库中的代码与文档为准。

实际体验

本稿没有在昇腾集群上执行训练,不写未经执行的实测结论。下面给出可复现的验证顺序,供有条件上手的人照着走。

第一步,先确认硬件前提是否满足——这套代码的运行环境是昇腾,不是通用 GPU 服务器,这一步不满足后面都不成立。第二步,到 Ascend Tribe 开源社区找到对应仓库,先看许可文件再决定能否用于你的用途,因为公告本身没有写明协议。第三步,用最小规模跑通一次预训练或微调的完整流程,重点看数据流水线和分布式并行配置是否在你的集群规模下能起得来。第四步,再进入 RL 环节,先复现官方给出的最小示例,确认 Actor、Rollout 与 Reward 的协同能跑通,再换自己的任务。

判断这套代码是否值得投入,看的是它在你的集群上的稳定性与吞吐,而不是公告里的能力描述。规模门槛摆在那里,中小团队更现实的用法是读代码学习工程结构,而不是直接上生产训练。

项目地址与获取方式

官方公告给出的入口是 Ascend Tribe 开源社区(gitcode.com/ascend-tribe),openPangu-2.0 的相关组件已陆续上线该平台。公告未逐个列出每个组件的仓库路径,具体地址请在开源社区内按组件名检索。

请通过官方开源社区获取代码,避免从第三方镜像或不明来源下载,以免拿到被篡改的版本。许可条款、依赖版本与硬件要求以仓库中当前文件为准。

适合谁用

  • 在昇腾集群上做百亿至万亿参数级模型预训练与微调的训练工程团队。
  • 需要参考昇腾原生训练与推理的工程做法、对照自家管线查漏的工程师。
  • 做 Agentic 后训练研究、希望有一套可跑的强化学习框架作为起点的高校与研究组。
  • 评估国产算力训练方案是否可落地的技术决策者,可以先读代码再判断迁移成本。
  • 不必急着跟进的情况:没有昇腾硬件、只想找一个开箱即用的推理服务,或者团队没有分布式训练运维经验——这套代码解决的是训练侧问题,不是部署侧问题。

常见问题

这次开源的是模型权重吗?

不是。本次公告明确的开源内容是预训练与 SFT 代码,以及后训练 RL 代码,属于训练框架层面。官方称 openPangu-2.0 的模型相关组件已陆续上线开源平台,但这次发布动作的主体是代码而非新权重,下载前请先确认你要的是哪一类。

必须要用昇腾硬件吗?

RL 框架官方明确面向华为昇腾。训练框架虽未在同一句里限定硬件,但整套代码的定位是昇腾原生训练与推理的工程参考,脱离该环境使用会遇到算子与并行的适配问题。没有对应硬件的话,阅读代码的价值大于运行代码的价值。

可以用于商业项目吗?

公告没有写明开源协议。商用前请以开源仓库中的许可文件为准,这一步不要跳过——不同组件的协议可能并不相同,而公告里没有给出统一说明。

和此前的 openPangu 版本是什么关系?

本次公告只说明 openPangu-2.0 的预训练、SFT 与后训练 RL 代码开源上线,未列版本演进的时间线。网络上关于各版本开源时间与参数规模的整理并非出自这份公告,本稿不予采信,建议以开源社区中的发布记录为准。

中小团队有上手路径吗?

有,但要调整预期。更现实的做法是先读训练框架的结构与并行策略实现,把工程思路迁移到自己的管线;真要跑训练,最小规模起步,先跑通流程再谈规模,避免在集群配置上一次性投入过多。

相关工具与内容

对国产模型与训练侧工具感兴趣的话,站内收录了 DeepSeek、通义千问 与 豆包,AI编程 分类下还有 CodeBuddy、Trae 与 Cursor 等编码工具。想搭自己的智能体流程,可以看 AI智能体 分类下的 扣子、Dify 与 n8n;做选型时的取舍思路,2026 年第四季度 AI 工具怎么选 里有更完整的对照。

Related
快讯 1 小时前

Claude Sonnet 5.5 发布:5.5 家族第二款模型

Anthropic 于 2026 年 9 月 28 日发布 Claude Sonnet 5.5,为 5.5 家族继 Opus 5.5 之后的第二款模型,官方定位为更快、更低成本的补充型号,已在 Claude 平台与三大云上线。

前沿快讯 0 阅读
快讯 1 小时前

Holo4 开源:能操作桌面与网页的通用智能体模型

H Company 于 2026 年 9 月 28 日发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B 混合专家两个尺寸,权重开放下载并提供托管 API,面向桌面、网页与移动端软件操作。

前沿快讯 0 阅读
评测 21 小时前

DeepSeek 4.4 分怎么来的:推理摊开看,模型还能自己部署

DeepSeek 在本站五维评测口径下总分 4.4,是对话类里得分最高的一款:可用性与成本效率都落在最有利档位,模型权重开放可本地部署。本文逐项给出打分依据、与 Kimi、ChatGPT、Claude、Perplexity 的横比,以及什么情况下该换工具。

评测 0 阅读
链接已复制