2026年7月31日,华为正式开放 openPangu-2.0-Pro模型权重、技术报告及基础推理代码。

image.png

openPangu-2.0-Pro是一款基于昇腾NPU完成训练的大规模混合专家语言模型,总参数约505B,即5050亿参数,每个Token实际激活约18B参数,并支持512K上下文。模型预训练数据规模约为34T Tokens。

模型目前已经上线GitCode和华为官方Hugging Face组织,同时提供原始版本与INT8量化版本。企业和开发者也可以通过华为云ModelArts Studio直接在线体验文本生成、深度思考与Function Call能力。

模型权重入口:

openPangu-2.0-Pro官方GitCode页面

华为云体验入口:

华为云ModelArts Studio

openPangu-2.0-Pro是什么?

openPangu是华为推出的开放AI模型品牌,重点围绕昇腾硬件建立原生训练、推理、算子和部署实践。

openPangu-2.0系列主要包含两个版本:

模型总参数每Token激活参数上下文定位
openPangu-2.0-Flash92B6B512K低成本、高吞吐、轻量部署
openPangu-2.0-Pro505B18B512K复杂推理、Agent、代码及专业任务

openPangu-2.0-Flash已于2026年6月30日先行开放模型权重、基础推理代码和训推算子;华为当时宣布,Pro版本的模型权重及推理代码将在7月上线。

Pro版本此次按计划开放,使openPangu-2.0系列形成了“Flash负责效率、Pro负责能力”的双模型组合。

openPangu-2.0-Pro核心参数

项目openPangu-2.0-Pro
模型类型大规模MoE语言模型
训练硬件华为昇腾NPU
总参数量约505B
激活参数量每Token约18B
上下文长度512K
训练数据规模约34T Tokens
注意力结构MLA+DSA+SWA
残差拓扑四分支mHC
推理加速三头MTP自投机
训练优化器Muon
思考模式Thinking与Non-Thinking
Agent能力Function Call、工具调用及长任务
推理框架omni-infer
推理硬件方向Ascend 910C
量化版本openPangu-2.0-Pro-Int8

以上规格来自openPangu官方模型卡。

5050亿参数并不代表每次都计算5050亿参数

openPangu-2.0-Pro采用混合专家架构。

模型虽然拥有约5050亿总参数,但在处理每个Token时,只激活约180亿参数,相当于每次调用约3.6%的模型参数参与计算。

MoE架构的主要目的,是在扩大模型总容量的同时,控制每次推理实际需要的计算量。

可以把它理解为模型内部包含大量不同领域的专家。当输入一段代码、数学题或办公任务时,路由系统会选择更适合当前Token的部分专家,而不是让所有专家同时运行。

这种方式能够同时获得:

  • 更大的知识和能力容量
  • 相对可控的单Token计算量
  • 更适合并行部署的模型结构
  • 更高的推理吞吐潜力

不过,18B激活参数并不代表完整模型可以按普通18B模型部署。完整权重仍然包含505B参数,对存储、内存和多卡通信的要求依然很高。

512K上下文可以处理什么?

openPangu-2.0-Pro原生支持512K上下文,可用于容纳更长的代码、文档和Agent执行记录。

适合的应用场景包括:

  • 大型代码仓库分析
  • 多份行业报告综合研究
  • 长篇合同与制度文档
  • 企业知识库问答
  • 长时间Agent工具调用
  • 多轮项目规划
  • 复杂数据分析任务
  • 数百页材料整理
  • 跨文档信息对照

但512K上下文并不意味着应用应该把所有文件一次性全部提交给模型。

正式系统仍需要结合:

  • 文档检索
  • 向量数据库
  • 上下文压缩
  • 历史对话摘要
  • 文件分块
  • 权限管理
  • 缓存策略

否则,大量无关内容会增加推理费用,也可能干扰模型判断。

MLA+DSA+SWA如何处理长上下文?

openPangu-2.0-Pro沿用了高效率的MLA注意力结构,同时采用DSA与SWA独立分层混合方案。

两类注意力层按照约1:2的比例排列:

  • SWA负责局部窗口建模
  • DSA负责稀疏的全局信息聚合

SWA负责局部上下文

Sliding Window Attention只关注当前Token附近的一段内容。

在语言、代码和文档中,大量关系都发生在局部范围内,例如:

  • 当前句子中的语法关系
  • 相邻代码行
  • 当前函数内部变量
  • 表格附近的数据
  • 同一段落中的指代

只处理局部窗口,可以减少长上下文中的计算和显存消耗。

DSA负责全局信息

长文档中仍然存在跨越很远距离的重要关系,例如:

  • 文档开头定义的规则
  • 代码仓库中的公共接口
  • 合同前后条款
  • Agent早期确定的任务目标
  • 不同报告中的相同指标

DSA负责从长上下文中筛选和聚合这些稀疏但重要的全局信息。

两种结构组合后,模型不必让所有Token之间都进行完整计算,而是把更多算力集中在真正需要建立关联的位置。

四分支mHC残差结构是什么?

openPangu-2.0-Pro将传统残差连接升级为四分支mHC架构。

官方模型卡表示,这项设计用于提高模型内部表征的多样性和泛化能力。

传统Transformer通常沿着一条主要残差路径传递信息。随着模型层数增加,不同层的特征可能不断混合,部分早期信息也可能被弱化。

多分支结构可以让不同特征沿多条路径传播,使模型更容易保留和组合不同层级的信息。

这种结构的实际价值需要结合技术报告和社区复现进一步判断,但从产品定位看,它主要服务于复杂推理、专业任务和长上下文理解。

三头MTP一次额外预测3个Token

openPangu-2.0-Pro内置三头MTP自投机模块。

普通自回归模型每执行一次前向计算,通常只生成一个新Token。

MTP会同时预测多个未来位置。openPangu-2.0-Pro的三头MTP可以一次额外预测3个Token,再对候选结果进行验证,从而减少逐Token解码产生的等待时间。

这类能力对以下任务尤其重要:

  • 长篇内容生成
  • 代码编写
  • 数学推理
  • Agent连续执行
  • 高并发API服务
  • 长思考过程

MTP能够提高多少实际速度,还取决于候选Token接受率、推理框架、并发量和昇腾集群配置,不能只根据“预测3个Token”直接推算为3倍加速。

Muon优化器用于提高训练收敛效率

openPangu-2.0-Pro在训练中采用Muon优化器。

华为称,该优化器能够帮助模型获得更快的训练收敛速度。

对于505B规模的MoE模型而言,训练效率不仅取决于模型结构,还取决于:

  • 优化器状态占用
  • 专家负载均衡
  • 多节点通信
  • 长序列训练
  • 梯度稳定性
  • 昇腾算子效率

Muon与MLA、DSA+SWA、mHC和MTP共同组成openPangu-2.0-Pro的主要架构升级。

34T Tokens训练与后训练流程

openPangu-2.0-Pro的预训练数据规模约为34T Tokens。

在预训练完成后,模型继续经历了三类主要后训练过程:

  1. 快慢思考合一的监督微调
  2. 多专项强化学习
  3. 在线蒸馏

快慢思考合一

模型同时提供Thinking和Non-Thinking两种使用方式。

需要复杂推理时,可以使用思考模式进行更长的分析;面对简单问答和高频任务时,则可以使用非思考模式降低等待时间与推理成本。

多专项强化学习

不同强化学习阶段可以分别加强:

  • 数学推理
  • 代码任务
  • 指令遵循
  • 工具调用
  • Agent执行
  • 专业知识任务

在线蒸馏

在线蒸馏用于将不同专项训练阶段获得的能力重新整合,让模型在统一版本中兼顾多个任务,而不是只在某一个评测方向表现突出。

官方测试表现

openPangu官方模型卡公布了Thinking与Non-Thinking两种模式的测试结果。

推理能力

测试项目ThinkingNon-Thinking
AIME 202695.487.3
AIME 2026+Python97.9
HMMT 2026年2月86.263.3
HMMT+Python93.2
IMO-AnswerBench84.360.8
GPQA-Diamond87.981.1
HLE27.19.0

Agent能力

测试项目ThinkingNon-Thinking
TAU2-Bench81.171.6
MCP-Atlas61.348.8
SkillsBench48.947.5
WildClawBench46.543.1
Claw-Eval61.749.4
GDPVal74.951.2
BrowseComp65.7

代码能力

测试项目ThinkingNon-Thinking
LiveCodeBench V685.774.5
DeepCodeBench74.272.6
SWE-bench Verified68.566.8
FeatBench47.148.4

以上结果来自华为官方模型卡,并非独立第三方统一盲测。不同模型的系统提示词、推理预算、工具环境和测试次数可能不同,因此不应直接用单项数字判断综合排名。

思考模式并非所有项目都更高

从官方数据看,Thinking模式在数学、深度推理和多数Agent任务上领先较明显。

但Non-Thinking模式也并非所有项目都更弱:

  • Chinese-SimpleQA中Non-Thinking为75.7,高于Thinking的74.2
  • PinchBench中Non-Thinking为88.9,高于Thinking的84.0
  • FeatBench中Non-Thinking为48.4,略高于Thinking的47.1

这说明更长的思考过程不一定适合所有任务。

实际应用可以按照任务难度进行路由:

使用Non-Thinking

  • 简单知识问答
  • 信息提取
  • 内容改写
  • 分类和标签
  • 高频客服
  • 基础代码补全
  • 结构化数据转换

使用Thinking

  • 数学推理
  • 复杂代码修复
  • Agent规划
  • 多约束决策
  • 深度研究
  • 长文档分析
  • 工具调用任务

openPangu-2.0-Pro与Flash如何选择?

对比方向openPangu-2.0-FlashopenPangu-2.0-Pro
总参数92B505B
激活参数6B18B
上下文512K512K
训练数据34T Tokens34T Tokens
部署门槛相对较低很高
推理成本更低更高
复杂推理适合常规任务更适合高难度任务
Agent能力高频执行复杂规划与执行
私有化部署中型集群大规模昇腾集群

两款模型使用相近的核心架构和后训练方向,但通过不同参数规模覆盖不同企业需求。

企业可以采用分层调用:

  • Flash处理大部分日常请求
  • Pro处理复杂推理与Agent任务
  • 简单任务使用非思考模式
  • 高难度任务切换到思考模式

权重、推理代码和INT8版本已经开放

此次开放内容主要包括:

  • openPangu-2.0-Pro原始模型权重
  • openPangu-2.0-Pro-Int8量化权重
  • openPangu-2.0技术报告
  • 基础推理代码
  • 模型配置
  • 部署说明
  • 评测数据

官方推理代码仓库为openPangu-2.0-Infer,面向Ascend 910C部署,并采用Apache 2.0许可证。

INT8量化版本也已同步上线。量化能够减少权重存储和推理内存占用,但具体精度变化、硬件规模和性能数据需要参考部署文档及实际业务测试。

“开源”需要区分模型权重与代码许可证

华为将openPangu定位为开源AI模型品牌,并在官方发布中使用“开源上线”的表述。

从严格许可证角度看,需要分别理解:

  • 模型权重:OPENPANGU MODEL LICENSE AGREEMENT VERSION 2.0
  • 基础推理代码:Apache License 2.0

因此,“华为开放模型权重与推理代码”是较准确的技术表述。

模型权重并非直接采用Apache 2.0或MIT等标准软件开源许可证。企业计划修改、分发、托管或用于商业服务前,应完整阅读OpenPangu Model License 2.0,而不能只根据“开源”两个字判断使用范围。

可以在普通电脑运行吗?

openPangu-2.0-Pro不适合普通个人电脑直接运行。

虽然每个Token只激活18B参数,但部署时仍需要存放和管理完整的505B模型权重。

其主要部署对象包括:

  • 昇腾算力集群
  • 云计算平台
  • 高校和研究机构
  • 大型企业AI团队
  • 推理服务商
  • 行业模型开发团队

官方基础推理项目面向Ascend 910C,并使用omni-infer框架。

个人开发者更适合:

  • 通过华为云MaaS调用
  • 使用92B的openPangu-2.0-Flash
  • 等待社区进一步量化
  • 在云端租用昇腾计算资源

华为云ModelArts Studio已经可以在线体验

openPangu-2.0-Pro已经上线华为云ModelArts Studio,提供:

  • 文本生成
  • 深度思考
  • Function Call
  • 在线体验
  • API调用

华为云页面当前显示的参考价格为:

输入长度缓存命中普通输入输出
低于32K0.8元/百万Token3.2元/百万Token14.5元/百万Token
32K及以上1.2元/百万Token4.8元/百万Token17.6元/百万Token

价格、活动与上下文分段规则可能继续调整,正式接入前应以华为云控制台中的实时计费页面为准。

openPangu-2.0-Pro适合哪些场景?

企业Agent

支持Function Call和深度思考,可以用于任务规划、工具调用和企业工作流。

代码开发

官方在LiveCodeBench、DeepCodeBench和SWE-bench Verified中公布了相应成绩,可用于代码生成、仓库修改和Bug修复。

深度研究

512K上下文可以处理较多网页、报告和企业资料,并结合搜索工具生成研究结果。

金融与行业分析

可用于处理年报、政策、行业数据和企业知识库,但高风险结论必须经过专业人员审核。

企业知识库

支持长文档输入,可用于制度查询、技术资料检索和内部问答。

数学与科学计算

Thinking模式在AIME、HMMT、GPQA-Diamond等官方测试中表现突出,也支持通过Python工具辅助计算。

国产算力私有化部署

对已经建设昇腾集群的企业而言,openPangu提供了从模型权重到推理代码的原生技术路线。

openPangu推动的不只是一个模型

openPangu-2.0-Pro的意义不仅是开放一个505B模型。

华为希望通过openPangu逐步开放和完善:

  • 模型权重
  • 基础推理代码
  • 预训练代码
  • 后训练代码
  • 训练与推理算子
  • 昇腾集群部署方案
  • 量化版本
  • 云端MaaS服务

华为在6月30日的官方公告中表示,openPangu-2.0相关组件将分阶段开放,更多组件将在2026年下半年继续上线。

这套路径的主要目标,是让开发者不仅可以下载模型,也能研究如何在昇腾硬件上完成训练、推理、量化和行业部署。

当前仍有哪些限制?

部署硬件门槛较高

505B总参数决定了完整模型仍然需要大规模计算和存储资源。

主要面向昇腾生态

官方推理代码以Ascend 910C为主要目标。CUDA、llama.cpp及其他GPU推理框架的兼容情况,需要社区继续适配。

官方测试不等于第三方排名

当前成绩主要由华为模型卡公布,需要更多独立榜单和实际业务测试验证。

512K不代表所有信息都能被准确利用

长上下文中的信息检索、位置偏差和无关内容干扰仍然需要应用层解决。

模型许可证为自定义协议

商业部署、二次发布和托管服务前,应单独审查OpenPangu Model License 2.0。

当前是纯语言模型

openPangu-2.0-Pro模型卡将其定位为语言模型,输入输出重点为文本,不应直接视为图片、音频或视频全模态模型。

总结

2026年7月31日,华为正式开放openPangu-2.0-Pro模型权重、技术报告及基础推理代码。

模型采用505B总参数、18B激活参数的MoE架构,支持512K上下文,并使用约34T Tokens完成预训练。后训练阶段融合快慢思考SFT、多专项强化学习和在线蒸馏。

在架构方面,openPangu-2.0-Pro引入:

  • MLA注意力
  • DSA+SWA分层混合结构
  • 四分支mHC拓扑
  • 三头MTP自投机模块
  • Muon优化器

这些技术主要用于降低长上下文计算成本、增强模型表征能力,并提高推理吞吐。

权重已经同步上线GitCode与华为官方Hugging Face组织,INT8量化版本和基于Ascend 910C的openPangu-2.0-Infer推理项目也已提供。

普通开发者可以通过华为云ModelArts Studio在线体验;已经部署昇腾集群的企业,则可以下载权重和推理代码进行私有化测试。

需要注意的是,模型权重使用OpenPangu Model License 2.0,推理代码则采用Apache 2.0许可证。企业在商业使用前仍需分别核对许可证和部署成本。

openPangu-2.0-Pro真正值得关注的地方,不只是5050亿参数,而是华为正在尝试提供一套从模型架构、权重、量化、推理代码到昇腾云服务的完整开放实践。

相关链接