华为发布 Peerium 计算架构:让百万处理器成为一台计算机,灵衢 + 昇腾 960 超节点同步落地
2026-09-19 · 上海证券报 / 环球网 / ChinaTechNews / 新浪科技 / 今日头条 AI 新闻日报
要点
架构层
- 09-17(上海)华为全联接大会 2026 发布 Peerium 计算架构:基于嵌套并行,通过统一内存寻址与平等互联实现百万级处理器强扩展。官方表述是突破图灵范式(提出 Nested BSP)、突破冯·诺依曼单机架构、颠覆主从架构。
- 关键互联技术 灵衢:基于开放协议的高速总线,可无限扩展地联接 CPU / NPU / 内存 / SSD / 网卡 / 交换机,实现计算、存储、网络的平等互联——访问远端内存与本地内存路径一致。
硬件层
- Atlas 950 超节点是 Peerium 的首代产品,25.6 万卡集群已在部署中;基于 NPO 的 Atlas 960 系统正在测试。
- 昇腾 960 超节点(基于「灵衢 + Hi-ONE」):全球首个采用 NPO 光引擎的超节点,正交架构 + 全液冷,基于灵衢实现内存统一编址,可扩展至 4096 卡,算力 8 EFLOPS FP8 / 16 EFLOPS FP4。
- 光电替代:用 5500 个 Hi-ONE 替代原本需要的 4.8 万颗 800G 光模块,功耗降低超 550 千瓦,无故障运行时间提升一倍,系统可用度 99.8%。
- 组网上限:多个 960 超节点通过灵衢网络或 RoCE 互联,二层 CLOS 四平面组网最大 51.2 万卡;结合多轨道拓扑最大支持 100 万卡。
- 研发进度(观察者网现场获悉):昇腾 960 DT 比预期提前三个季度,预计 2027 年一季度就绪;960 PR 提前一个季度,预计 2027 年三季度就绪。
软件与生态层
- CANN 外部开发者首次超过内部开发者,占比 61%,社区月活开发者突破 5200 名;基于昇腾 + CANN 的原生训练模型已超 40 个。
- 在 Linux 基金会支持下,昇腾成为可在 PyTorch 官网直接安装的算力平台,也是首个来自中国的算力平台。
云与 Agent 层
- 华为云 灵衢昇腾 950 智算集群云服务:09-30 国内商用、11-30 全球商用,1024 卡规模,提供 1 EFLOPS FP8 / 2 EFLOPS FP4,256TB 全局统一内存编址空间。
- 同步推出 Agentic MaaS 平台、企业级智能体平台智果 AgentArts(已服务 100+ 企业)、CMS 记忆存储(构建 PB 级记忆空间)。
- 开源 openJiuwen 智能体平台:支持多智能体协作、全链路自进化、企业级治理(防资源冲突与权限重叠)。
方法论与安全
- 发布 AI 落地七步法 + DIMAK 工程体系(数据、基础设施、模型、Agent、知识工程)。华为监事会副主席陶景文强调:企业流程必须围绕人机协同重构,而不是表面自动化。
- 发布 AI 防火墙技术白皮书:防御逻辑从规则驱动匹配转向意图感知治理,实现自主策略生成、智能运维闭环,硬件解耦 / 软件隔离 / 引擎级信任根。
背景与分析
一、Peerium 要解决的是「堆卡损耗」这个老问题
传统集群扩容有个绕不过去的痛点:节点越多,跨机数据传输与调度开销越大,算力损耗越难规避。 这是大模型训练长期面对的结构性问题——名义算力增长快,有效算力增长慢。
Peerium 的解法分三层:
| 层 | 做法 | 解决什么 |
|---|---|---|
| 编程模型 | Nested BSP(嵌套并行) | 让并行结构可嵌套表达,突破图灵范式的单层并行 |
| 内存 | 统一内存寻址 | 访问远端内存与本地内存路径一致,消除「本地/远端」的心智与调度负担 |
| 互联 | 灵衢平等互联 | CPU/NPU/内存/SSD/网卡/交换机在同一条开放协议总线上,不再有主从 |
「颠覆主从架构」这句话是这三者里最关键的一条。 传统集群里总有一个主机在调度,Peerium 把调度平面也做成平等的——这决定了它能把规模推到百万级而不塌。
二、昇腾 960 的真正亮点不是算力,是「用 5500 个光引擎换掉 4.8 万个光模块」
8 EFLOPS FP8 这个数字当然重要,但工程上更值得看的是这一段:
- 4.8 万颗 800G 光模块 → 5500 个 Hi-ONE 光引擎
- 功耗降低超 550 千瓦
- 系统可用度 99.8%,无故障运行时间翻倍
光模块是超节点里故障率最高、功耗占比最大的部件之一。 把数量砍掉近九成,同时把可用度提到 99.8%,这是系统级工程收益,不是单点参数突破。对真实训练任务来说,可用度从 99.6% 提到 99.8%,意味着万卡任务被中断的概率显著降低——长周期训练里,这比峰值算力更值钱。
三、CANN 外部开发者超过内部,是这次发布里最容易被低估的一条
61% 这个数字的意义在于:昇腾的软件栈第一次不再主要靠华为自己的人写。
配套的两个事实同样关键:
- 基于昇腾 + CANN 的原生训练模型超 40 个——说明这条路线真的能训,不只是能推理;
- 昇腾可在 PyTorch 官网直接安装——意味着开发者不需要为了用昇腾而改工作习惯。
生态战打到最后,比的不是谁卡快,是谁的默认值更省事。 「PyTorch 官网直接安装」把昇腾从「需要专门适配」变成了「装完就能跑」,这是降低迁移成本最直接的一招。
四、openJiuwen 开源 + Agentic MaaS:华为把 Agent 层也补齐了
这次大会的另一条主线是 Agent:
- openJiuwen 开源智能体平台,主打多智能体协作、全链路自进化、企业级治理;
- 智果 AgentArts 企业级智能体平台,已服务 100+ 企业;
- CMS 记忆存储,构建 PB 级记忆空间——这是把「记忆」当成了基础设施来建,而不是应用功能。
「企业级治理(防资源冲突与权限重叠)」这个卖点很实在。 多 Agent 系统在企业里真正翻车的方式,往往不是能力不够,而是两个 Agent 抢同一个资源、或者权限边界不清导致越权。华为把它放进平台层,说明它看到的客户痛点在这一层。
对开发者的影响
- 做国产算力适配的,现在可以把昇腾当成默认可选项之一。 「PyTorch 官网直接安装」是最强的迁移信号;但要确认你的模型在 CANN 上有对应算子,算子缺失仍是最常见的卡点。
- 长周期训练选型时,把「系统可用度」写进评估表。 昇腾 960 的 99.8% 可用度与功耗降低 550kW 是实打实的 TCO 项——峰值 FLOPS 只决定跑多快,可用度决定能不能跑完。
- 多 Agent 系统上线前先定治理规则。 openJiuwen 把资源冲突与权限重叠做成平台能力,反过来说明这是真实高频故障;自建 Agent 平台时,这一层不要留到后面补。
- 关注灵衢的开放协议定位。 如果它真的成为可无限扩展的开放总线标准,围绕它的互联生态(SSD、网卡、交换机)会出现新的适配机会;但协议细节与开放程度尚待公开文档确认。
- 企业引入 AI 别只做「表面自动化」。 华为七步法的第一句是「理解核心商业逻辑、用专门评估方法选高价值生产场景」——这句话适用于所有不做 AI 基础设施的团队。
AI 之家 观点
- Peerium 是国产在计算底层架构层面少有的一次「范式级」尝试。 不管最后市场接受度如何,敢于把冯·诺依曼单机架构和主从架构同时列为突破对象,本身就说明华为判断「堆卡」这条路已经到头了。
- 「百万处理器成为一台计算机」要打折扣看。 100 万卡是结合多轨道拓扑的理论上限,51.2 万卡是二层 CLOS 四平面组网的上限,Atlas 950 实际部署规模是 25.6 万卡。引用时请用「已部署」的那个数字,别用「最大支持」。
- 昇腾 960 提前三/一个季度,是个需要验证的乐观信号。 芯片研发提前流片通常意味着良率或设计风险低于预期;但从「就绪」到「规模交付」之间还有一个产能爬坡,2027 Q1/Q3 这两个时点请以华为后续公告为准。
- 对国内 AI 基建的判断:算力供给正在从「卡不够」转向「电不够、光模块不够、可用度不够」。 华为这次的交代几乎全在这三件事上(功耗 -550kW、光模块砍九成、可用度 99.8%)——这是全行业共同的瓶颈,不只是华为的。
- 开源 openJiuwen 是差异化动作。 在闭源 Agent 平台扎堆的当下,用 Apache 类开源协议把企业级治理能力放出去,能换来的适配者比卖 license 多。具体协议条款待官方仓库确认。
- 别忽略时间表:灵衢昇腾 950 云服务 09-30 国内商用、11-30 全球商用——想先验证的团队,10 月就能上手;海外团队要等到 11 月底。
待核实:昇腾 960 的「提前三/一个季度」与 2027 Q1/Q3 时点为观察者网在 HC 2026 现场获悉的口径,非华为正式产品路线图;51.2 万卡 / 100 万卡为组网理论上限而非已交付规模;openJiuwen 的具体开源协议以其官方仓库为准;「外部开发者占比 61%」「月活 5200 名」为华为大会口径。
相关阅读
- 本期专题:Manus 估值翻倍至 40 亿美元 · Crusoe 39 亿美元 Series F · AI 编程周报 2026-09-19
- 政策与产业:工信部「人工智能+软件」行动方案 · 英伟达收购 Hugging Face
- 工具卡:vLLM · Dify · CodeGeex · 通义灵码
- 概念:MoE · AI Agent · Agent Memory
来源
- 华为发布 AI 时代计算架构:让百万处理器成为一台计算机(上海证券报·中国证券网)
- Peerium Architecture and AI Firewalls Lead Huawei Push Into Chinese Enterprise Intelligence(ChinaTechNews)
- 华为推出 AI 时代新计算架构:百万处理器成为一台计算机(新浪,含昇腾 960 现场信息)
- 华为发布 Peerium 计算架构 实现百万级处理器强扩展(环球网 / 今日头条)
- AI 新闻日报 · 2026 年 9 月 18 日(今日头条,含华为云集群商用时间)
- AI 日报(2026 年 9 月 18 日)(掘金)
本资讯由 AI 之家 编辑部基于公开报道整理,非厂商付费内容;产品参数与商用时间以华为官方公告为准,欢迎在 反馈邮箱 反馈更新。