← 返回

华为505B纯昇腾大模型开源,但参数规模不是重点

詹叔 · 2026年08月01日

说实话,第一眼看到505B这个数字我有点意外。

不是嫌小。而是余承东自己解释了为什么只有505B——他说华为的算力”大量支持了国内其他企业需求”,自己留的数量非常有限。

这句话信息量很大。华为不是做不出更大的模型,而是在做算力分配。昇腾产能就那么多,给谁不给谁,是一个战略决策。华为选择了把自己留的那部分做成开源模型,同时把算力分给国内其他企业用。

这个选择比模型本身更值得想。

回到模型。openPangu-2.0-Pro,505B总参数,18B激活,MoE架构,512K上下文,34T tokens训练。今天在GitCode昇腾社区开源了权重和技术报告。

真正重要的细节是这个模型全程在昇腾NPU上训练,没用任何英伟达芯片。

505B不是千亿级别最大的开源模型。Kimi K3更大。但Kimi K3是在英伟达集群上训的。用纯国产算力训到505B并且开源,这是第一次。在中美芯片脱钩的背景下,”能不能在昇腾上训千亿模型”从理论验证变成了工程落地。

还有一个容易被忽略的点。官方说这个模型在昇腾上的单卡吞吐率是其他主流开源模型的2倍。这意味着它不是”在昇腾上凑合能跑”,而是专门为昇腾的架构做了深度优化——DSA+SWA分层混合注意力、3头MTP投机解码。这些设计让它在自家硬件上反而比通用架构跑得更快。

翻译一下:华为不只是做了一个模型,是做了一个”昇腾生态的标杆”。openPangu存在的意义是证明——昇腾不只是英伟达的替代品,它有自己的最优解。

6月30日先开源了92B的Flash版,今天补上了505B的Pro版。余承东在HDC上承诺的7大组件开源计划在逐步兑现。

来源:https://www.ithome.com/0/983/966.htm

关注 SomethingAI 公众号

每日 AI 趋势日报,深度选题分析,独立开发思考

微信搜索「SomethingAI」关注