2026年7月31日,华为正式开放 openPangu-2.0-Pro模型权重、技术报告及基础推理代码。

openPangu-2.0-Pro是一款基于昇腾NPU完成训练的大规模混合专家语言模型,总参数约505B,即5050亿参数,每个Token实际激活约18B参数,并支持512K上下文。模型预训练数据规模约为34T Tokens。
模型目前已经上线GitCode和华为官方Hugging Face组织,同时提供原始版本与INT8量化版本。企业和开发者也可以通过华为云ModelArts Studio直接在线体验文本生成、深度思考与Function Call能力。
模型权重入口:
华为云体验入口:
openPangu-2.0-Pro是什么?
openPangu是华为推出的开放AI模型品牌,重点围绕昇腾硬件建立原生训练、推理、算子和部署实践。
openPangu-2.0系列主要包含两个版本:
| 模型 | 总参数 | 每Token激活参数 | 上下文 | 定位 |
|---|---|---|---|---|
| openPangu-2.0-Flash | 92B | 6B | 512K | 低成本、高吞吐、轻量部署 |
| openPangu-2.0-Pro | 505B | 18B | 512K | 复杂推理、Agent、代码及专业任务 |
openPangu-2.0-Flash已于2026年6月30日先行开放模型权重、基础推理代码和训推算子;华为当时宣布,Pro版本的模型权重及推理代码将在7月上线。
Pro版本此次按计划开放,使openPangu-2.0系列形成了“Flash负责效率、Pro负责能力”的双模型组合。
openPangu-2.0-Pro核心参数
| 项目 | openPangu-2.0-Pro |
| 模型类型 | 大规模MoE语言模型 |
| 训练硬件 | 华为昇腾NPU |
| 总参数量 | 约505B |
| 激活参数量 | 每Token约18B |
| 上下文长度 | 512K |
| 训练数据规模 | 约34T Tokens |
| 注意力结构 | MLA+DSA+SWA |
| 残差拓扑 | 四分支mHC |
| 推理加速 | 三头MTP自投机 |
| 训练优化器 | Muon |
| 思考模式 | Thinking与Non-Thinking |
| Agent能力 | Function Call、工具调用及长任务 |
| 推理框架 | omni-infer |
| 推理硬件方向 | Ascend 910C |
| 量化版本 | openPangu-2.0-Pro-Int8 |
以上规格来自openPangu官方模型卡。
5050亿参数并不代表每次都计算5050亿参数
openPangu-2.0-Pro采用混合专家架构。
模型虽然拥有约5050亿总参数,但在处理每个Token时,只激活约180亿参数,相当于每次调用约3.6%的模型参数参与计算。
MoE架构的主要目的,是在扩大模型总容量的同时,控制每次推理实际需要的计算量。
可以把它理解为模型内部包含大量不同领域的专家。当输入一段代码、数学题或办公任务时,路由系统会选择更适合当前Token的部分专家,而不是让所有专家同时运行。
这种方式能够同时获得:
- 更大的知识和能力容量
- 相对可控的单Token计算量
- 更适合并行部署的模型结构
- 更高的推理吞吐潜力
不过,18B激活参数并不代表完整模型可以按普通18B模型部署。完整权重仍然包含505B参数,对存储、内存和多卡通信的要求依然很高。
512K上下文可以处理什么?
openPangu-2.0-Pro原生支持512K上下文,可用于容纳更长的代码、文档和Agent执行记录。
适合的应用场景包括:
- 大型代码仓库分析
- 多份行业报告综合研究
- 长篇合同与制度文档
- 企业知识库问答
- 长时间Agent工具调用
- 多轮项目规划
- 复杂数据分析任务
- 数百页材料整理
- 跨文档信息对照
但512K上下文并不意味着应用应该把所有文件一次性全部提交给模型。
正式系统仍需要结合:
- 文档检索
- 向量数据库
- 上下文压缩
- 历史对话摘要
- 文件分块
- 权限管理
- 缓存策略
否则,大量无关内容会增加推理费用,也可能干扰模型判断。
MLA+DSA+SWA如何处理长上下文?
openPangu-2.0-Pro沿用了高效率的MLA注意力结构,同时采用DSA与SWA独立分层混合方案。
两类注意力层按照约1:2的比例排列:
- SWA负责局部窗口建模
- DSA负责稀疏的全局信息聚合
SWA负责局部上下文
Sliding Window Attention只关注当前Token附近的一段内容。
在语言、代码和文档中,大量关系都发生在局部范围内,例如:
- 当前句子中的语法关系
- 相邻代码行
- 当前函数内部变量
- 表格附近的数据
- 同一段落中的指代
只处理局部窗口,可以减少长上下文中的计算和显存消耗。
DSA负责全局信息
长文档中仍然存在跨越很远距离的重要关系,例如:
- 文档开头定义的规则
- 代码仓库中的公共接口
- 合同前后条款
- Agent早期确定的任务目标
- 不同报告中的相同指标
DSA负责从长上下文中筛选和聚合这些稀疏但重要的全局信息。
两种结构组合后,模型不必让所有Token之间都进行完整计算,而是把更多算力集中在真正需要建立关联的位置。
四分支mHC残差结构是什么?
openPangu-2.0-Pro将传统残差连接升级为四分支mHC架构。
官方模型卡表示,这项设计用于提高模型内部表征的多样性和泛化能力。
传统Transformer通常沿着一条主要残差路径传递信息。随着模型层数增加,不同层的特征可能不断混合,部分早期信息也可能被弱化。
多分支结构可以让不同特征沿多条路径传播,使模型更容易保留和组合不同层级的信息。
这种结构的实际价值需要结合技术报告和社区复现进一步判断,但从产品定位看,它主要服务于复杂推理、专业任务和长上下文理解。
三头MTP一次额外预测3个Token
openPangu-2.0-Pro内置三头MTP自投机模块。
普通自回归模型每执行一次前向计算,通常只生成一个新Token。
MTP会同时预测多个未来位置。openPangu-2.0-Pro的三头MTP可以一次额外预测3个Token,再对候选结果进行验证,从而减少逐Token解码产生的等待时间。
这类能力对以下任务尤其重要:
- 长篇内容生成
- 代码编写
- 数学推理
- Agent连续执行
- 高并发API服务
- 长思考过程
MTP能够提高多少实际速度,还取决于候选Token接受率、推理框架、并发量和昇腾集群配置,不能只根据“预测3个Token”直接推算为3倍加速。
Muon优化器用于提高训练收敛效率
openPangu-2.0-Pro在训练中采用Muon优化器。
华为称,该优化器能够帮助模型获得更快的训练收敛速度。
对于505B规模的MoE模型而言,训练效率不仅取决于模型结构,还取决于:
- 优化器状态占用
- 专家负载均衡
- 多节点通信
- 长序列训练
- 梯度稳定性
- 昇腾算子效率
Muon与MLA、DSA+SWA、mHC和MTP共同组成openPangu-2.0-Pro的主要架构升级。
34T Tokens训练与后训练流程
openPangu-2.0-Pro的预训练数据规模约为34T Tokens。
在预训练完成后,模型继续经历了三类主要后训练过程:
- 快慢思考合一的监督微调
- 多专项强化学习
- 在线蒸馏
快慢思考合一
模型同时提供Thinking和Non-Thinking两种使用方式。
需要复杂推理时,可以使用思考模式进行更长的分析;面对简单问答和高频任务时,则可以使用非思考模式降低等待时间与推理成本。
多专项强化学习
不同强化学习阶段可以分别加强:
- 数学推理
- 代码任务
- 指令遵循
- 工具调用
- Agent执行
- 专业知识任务
在线蒸馏
在线蒸馏用于将不同专项训练阶段获得的能力重新整合,让模型在统一版本中兼顾多个任务,而不是只在某一个评测方向表现突出。
官方测试表现
openPangu官方模型卡公布了Thinking与Non-Thinking两种模式的测试结果。
推理能力
| 测试项目 | Thinking | Non-Thinking |
| AIME 2026 | 95.4 | 87.3 |
| AIME 2026+Python | 97.9 | — |
| HMMT 2026年2月 | 86.2 | 63.3 |
| HMMT+Python | 93.2 | — |
| IMO-AnswerBench | 84.3 | 60.8 |
| GPQA-Diamond | 87.9 | 81.1 |
| HLE | 27.1 | 9.0 |
Agent能力
| 测试项目 | Thinking | Non-Thinking |
| TAU2-Bench | 81.1 | 71.6 |
| MCP-Atlas | 61.3 | 48.8 |
| SkillsBench | 48.9 | 47.5 |
| WildClawBench | 46.5 | 43.1 |
| Claw-Eval | 61.7 | 49.4 |
| GDPVal | 74.9 | 51.2 |
| BrowseComp | 65.7 | — |
代码能力
| 测试项目 | Thinking | Non-Thinking |
| LiveCodeBench V6 | 85.7 | 74.5 |
| DeepCodeBench | 74.2 | 72.6 |
| SWE-bench Verified | 68.5 | 66.8 |
| FeatBench | 47.1 | 48.4 |
以上结果来自华为官方模型卡,并非独立第三方统一盲测。不同模型的系统提示词、推理预算、工具环境和测试次数可能不同,因此不应直接用单项数字判断综合排名。
思考模式并非所有项目都更高
从官方数据看,Thinking模式在数学、深度推理和多数Agent任务上领先较明显。
但Non-Thinking模式也并非所有项目都更弱:
- Chinese-SimpleQA中Non-Thinking为75.7,高于Thinking的74.2
- PinchBench中Non-Thinking为88.9,高于Thinking的84.0
- FeatBench中Non-Thinking为48.4,略高于Thinking的47.1
这说明更长的思考过程不一定适合所有任务。
实际应用可以按照任务难度进行路由:
使用Non-Thinking
- 简单知识问答
- 信息提取
- 内容改写
- 分类和标签
- 高频客服
- 基础代码补全
- 结构化数据转换
使用Thinking
- 数学推理
- 复杂代码修复
- Agent规划
- 多约束决策
- 深度研究
- 长文档分析
- 工具调用任务
openPangu-2.0-Pro与Flash如何选择?
| 对比方向 | openPangu-2.0-Flash | openPangu-2.0-Pro |
| 总参数 | 92B | 505B |
| 激活参数 | 6B | 18B |
| 上下文 | 512K | 512K |
| 训练数据 | 34T Tokens | 34T Tokens |
| 部署门槛 | 相对较低 | 很高 |
| 推理成本 | 更低 | 更高 |
| 复杂推理 | 适合常规任务 | 更适合高难度任务 |
| Agent能力 | 高频执行 | 复杂规划与执行 |
| 私有化部署 | 中型集群 | 大规模昇腾集群 |
两款模型使用相近的核心架构和后训练方向,但通过不同参数规模覆盖不同企业需求。
企业可以采用分层调用:
- Flash处理大部分日常请求
- Pro处理复杂推理与Agent任务
- 简单任务使用非思考模式
- 高难度任务切换到思考模式
权重、推理代码和INT8版本已经开放
此次开放内容主要包括:
- openPangu-2.0-Pro原始模型权重
- openPangu-2.0-Pro-Int8量化权重
- openPangu-2.0技术报告
- 基础推理代码
- 模型配置
- 部署说明
- 评测数据
官方推理代码仓库为openPangu-2.0-Infer,面向Ascend 910C部署,并采用Apache 2.0许可证。
INT8量化版本也已同步上线。量化能够减少权重存储和推理内存占用,但具体精度变化、硬件规模和性能数据需要参考部署文档及实际业务测试。
“开源”需要区分模型权重与代码许可证
华为将openPangu定位为开源AI模型品牌,并在官方发布中使用“开源上线”的表述。
从严格许可证角度看,需要分别理解:
- 模型权重:OPENPANGU MODEL LICENSE AGREEMENT VERSION 2.0
- 基础推理代码:Apache License 2.0
因此,“华为开放模型权重与推理代码”是较准确的技术表述。
模型权重并非直接采用Apache 2.0或MIT等标准软件开源许可证。企业计划修改、分发、托管或用于商业服务前,应完整阅读OpenPangu Model License 2.0,而不能只根据“开源”两个字判断使用范围。
可以在普通电脑运行吗?
openPangu-2.0-Pro不适合普通个人电脑直接运行。
虽然每个Token只激活18B参数,但部署时仍需要存放和管理完整的505B模型权重。
其主要部署对象包括:
- 昇腾算力集群
- 云计算平台
- 高校和研究机构
- 大型企业AI团队
- 推理服务商
- 行业模型开发团队
官方基础推理项目面向Ascend 910C,并使用omni-infer框架。
个人开发者更适合:
- 通过华为云MaaS调用
- 使用92B的openPangu-2.0-Flash
- 等待社区进一步量化
- 在云端租用昇腾计算资源
华为云ModelArts Studio已经可以在线体验
openPangu-2.0-Pro已经上线华为云ModelArts Studio,提供:
- 文本生成
- 深度思考
- Function Call
- 在线体验
- API调用
华为云页面当前显示的参考价格为:
| 输入长度 | 缓存命中 | 普通输入 | 输出 |
| 低于32K | 0.8元/百万Token | 3.2元/百万Token | 14.5元/百万Token |
| 32K及以上 | 1.2元/百万Token | 4.8元/百万Token | 17.6元/百万Token |
价格、活动与上下文分段规则可能继续调整,正式接入前应以华为云控制台中的实时计费页面为准。
openPangu-2.0-Pro适合哪些场景?
企业Agent
支持Function Call和深度思考,可以用于任务规划、工具调用和企业工作流。
代码开发
官方在LiveCodeBench、DeepCodeBench和SWE-bench Verified中公布了相应成绩,可用于代码生成、仓库修改和Bug修复。
深度研究
512K上下文可以处理较多网页、报告和企业资料,并结合搜索工具生成研究结果。
金融与行业分析
可用于处理年报、政策、行业数据和企业知识库,但高风险结论必须经过专业人员审核。
企业知识库
支持长文档输入,可用于制度查询、技术资料检索和内部问答。
数学与科学计算
Thinking模式在AIME、HMMT、GPQA-Diamond等官方测试中表现突出,也支持通过Python工具辅助计算。
国产算力私有化部署
对已经建设昇腾集群的企业而言,openPangu提供了从模型权重到推理代码的原生技术路线。
openPangu推动的不只是一个模型
openPangu-2.0-Pro的意义不仅是开放一个505B模型。
华为希望通过openPangu逐步开放和完善:
- 模型权重
- 基础推理代码
- 预训练代码
- 后训练代码
- 训练与推理算子
- 昇腾集群部署方案
- 量化版本
- 云端MaaS服务
华为在6月30日的官方公告中表示,openPangu-2.0相关组件将分阶段开放,更多组件将在2026年下半年继续上线。
这套路径的主要目标,是让开发者不仅可以下载模型,也能研究如何在昇腾硬件上完成训练、推理、量化和行业部署。
当前仍有哪些限制?
部署硬件门槛较高
505B总参数决定了完整模型仍然需要大规模计算和存储资源。
主要面向昇腾生态
官方推理代码以Ascend 910C为主要目标。CUDA、llama.cpp及其他GPU推理框架的兼容情况,需要社区继续适配。
官方测试不等于第三方排名
当前成绩主要由华为模型卡公布,需要更多独立榜单和实际业务测试验证。
512K不代表所有信息都能被准确利用
长上下文中的信息检索、位置偏差和无关内容干扰仍然需要应用层解决。
模型许可证为自定义协议
商业部署、二次发布和托管服务前,应单独审查OpenPangu Model License 2.0。
当前是纯语言模型
openPangu-2.0-Pro模型卡将其定位为语言模型,输入输出重点为文本,不应直接视为图片、音频或视频全模态模型。
总结
2026年7月31日,华为正式开放openPangu-2.0-Pro模型权重、技术报告及基础推理代码。
模型采用505B总参数、18B激活参数的MoE架构,支持512K上下文,并使用约34T Tokens完成预训练。后训练阶段融合快慢思考SFT、多专项强化学习和在线蒸馏。
在架构方面,openPangu-2.0-Pro引入:
- MLA注意力
- DSA+SWA分层混合结构
- 四分支mHC拓扑
- 三头MTP自投机模块
- Muon优化器
这些技术主要用于降低长上下文计算成本、增强模型表征能力,并提高推理吞吐。
权重已经同步上线GitCode与华为官方Hugging Face组织,INT8量化版本和基于Ascend 910C的openPangu-2.0-Infer推理项目也已提供。
普通开发者可以通过华为云ModelArts Studio在线体验;已经部署昇腾集群的企业,则可以下载权重和推理代码进行私有化测试。
需要注意的是,模型权重使用OpenPangu Model License 2.0,推理代码则采用Apache 2.0许可证。企业在商业使用前仍需分别核对许可证和部署成本。
openPangu-2.0-Pro真正值得关注的地方,不只是5050亿参数,而是华为正在尝试提供一套从模型架构、权重、量化、推理代码到昇腾云服务的完整开放实践。










评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。