跳到主内容

华为发布 Peerium 计算架构:让百万处理器成为一台计算机,灵衢 + 昇腾 960 超节点同步落地

2026-09-19 · 上海证券报 / 环球网 / ChinaTechNews / 新浪科技 / 今日头条 AI 新闻日报

要点

架构层

  • 09-17(上海)华为全联接大会 2026 发布 Peerium 计算架构:基于嵌套并行,通过统一内存寻址平等互联实现百万级处理器强扩展。官方表述是突破图灵范式(提出 Nested BSP)、突破冯·诺依曼单机架构、颠覆主从架构
  • 关键互联技术 灵衢:基于开放协议的高速总线,可无限扩展地联接 CPU / NPU / 内存 / SSD / 网卡 / 交换机,实现计算、存储、网络的平等互联——访问远端内存与本地内存路径一致。

硬件层

  • Atlas 950 超节点是 Peerium 的首代产品,25.6 万卡集群已在部署中;基于 NPO 的 Atlas 960 系统正在测试。
  • 昇腾 960 超节点(基于「灵衢 + Hi-ONE」):全球首个采用 NPO 光引擎的超节点,正交架构 + 全液冷,基于灵衢实现内存统一编址,可扩展至 4096 卡,算力 8 EFLOPS FP8 / 16 EFLOPS FP4
  • 光电替代:用 5500 个 Hi-ONE 替代原本需要的 4.8 万颗 800G 光模块功耗降低超 550 千瓦,无故障运行时间提升一倍,系统可用度 99.8%
  • 组网上限:多个 960 超节点通过灵衢网络或 RoCE 互联,二层 CLOS 四平面组网最大 51.2 万卡;结合多轨道拓扑最大支持 100 万卡
  • 研发进度(观察者网现场获悉):昇腾 960 DT 比预期提前三个季度,预计 2027 年一季度就绪;960 PR 提前一个季度,预计 2027 年三季度就绪。

软件与生态层

  • CANN 外部开发者首次超过内部开发者,占比 61%,社区月活开发者突破 5200 名;基于昇腾 + CANN 的原生训练模型已超 40 个
  • 在 Linux 基金会支持下,昇腾成为可在 PyTorch 官网直接安装的算力平台,也是首个来自中国的算力平台。

云与 Agent 层

  • 华为云 灵衢昇腾 950 智算集群云服务09-30 国内商用、11-30 全球商用,1024 卡规模,提供 1 EFLOPS FP8 / 2 EFLOPS FP4256TB 全局统一内存编址空间
  • 同步推出 Agentic MaaS 平台、企业级智能体平台智果 AgentArts(已服务 100+ 企业)、CMS 记忆存储(构建 PB 级记忆空间)。
  • 开源 openJiuwen 智能体平台:支持多智能体协作、全链路自进化、企业级治理(防资源冲突与权限重叠)。

方法论与安全

  • 发布 AI 落地七步法 + DIMAK 工程体系(数据、基础设施、模型、Agent、知识工程)。华为监事会副主席陶景文强调:企业流程必须围绕人机协同重构,而不是表面自动化
  • 发布 AI 防火墙技术白皮书:防御逻辑从规则驱动匹配转向意图感知治理,实现自主策略生成、智能运维闭环,硬件解耦 / 软件隔离 / 引擎级信任根。

背景与分析

一、Peerium 要解决的是「堆卡损耗」这个老问题

传统集群扩容有个绕不过去的痛点:节点越多,跨机数据传输与调度开销越大,算力损耗越难规避。 这是大模型训练长期面对的结构性问题——名义算力增长快,有效算力增长慢。

Peerium 的解法分三层:

做法解决什么
编程模型Nested BSP(嵌套并行)让并行结构可嵌套表达,突破图灵范式的单层并行
内存统一内存寻址访问远端内存与本地内存路径一致,消除「本地/远端」的心智与调度负担
互联灵衢平等互联CPU/NPU/内存/SSD/网卡/交换机在同一条开放协议总线上,不再有主从

「颠覆主从架构」这句话是这三者里最关键的一条。 传统集群里总有一个主机在调度,Peerium 把调度平面也做成平等的——这决定了它能把规模推到百万级而不塌。

二、昇腾 960 的真正亮点不是算力,是「用 5500 个光引擎换掉 4.8 万个光模块」

8 EFLOPS FP8 这个数字当然重要,但工程上更值得看的是这一段:

  • 4.8 万颗 800G 光模块 → 5500 个 Hi-ONE 光引擎
  • 功耗降低超 550 千瓦
  • 系统可用度 99.8%,无故障运行时间翻倍

光模块是超节点里故障率最高、功耗占比最大的部件之一。 把数量砍掉近九成,同时把可用度提到 99.8%,这是系统级工程收益,不是单点参数突破。对真实训练任务来说,可用度从 99.6% 提到 99.8%,意味着万卡任务被中断的概率显著降低——长周期训练里,这比峰值算力更值钱。

三、CANN 外部开发者超过内部,是这次发布里最容易被低估的一条

61% 这个数字的意义在于:昇腾的软件栈第一次不再主要靠华为自己的人写。

配套的两个事实同样关键:

  • 基于昇腾 + CANN 的原生训练模型超 40 个——说明这条路线真的能训,不只是能推理;
  • 昇腾可在 PyTorch 官网直接安装——意味着开发者不需要为了用昇腾而改工作习惯。

生态战打到最后,比的不是谁卡快,是谁的默认值更省事。 「PyTorch 官网直接安装」把昇腾从「需要专门适配」变成了「装完就能跑」,这是降低迁移成本最直接的一招。

四、openJiuwen 开源 + Agentic MaaS:华为把 Agent 层也补齐了

这次大会的另一条主线是 Agent:

  • openJiuwen 开源智能体平台,主打多智能体协作、全链路自进化、企业级治理;
  • 智果 AgentArts 企业级智能体平台,已服务 100+ 企业;
  • CMS 记忆存储,构建 PB 级记忆空间——这是把「记忆」当成了基础设施来建,而不是应用功能。

「企业级治理(防资源冲突与权限重叠)」这个卖点很实在。 多 Agent 系统在企业里真正翻车的方式,往往不是能力不够,而是两个 Agent 抢同一个资源、或者权限边界不清导致越权。华为把它放进平台层,说明它看到的客户痛点在这一层。

对开发者的影响

  • 做国产算力适配的,现在可以把昇腾当成默认可选项之一。 「PyTorch 官网直接安装」是最强的迁移信号;但要确认你的模型在 CANN 上有对应算子,算子缺失仍是最常见的卡点。
  • 长周期训练选型时,把「系统可用度」写进评估表。 昇腾 960 的 99.8% 可用度与功耗降低 550kW 是实打实的 TCO 项——峰值 FLOPS 只决定跑多快,可用度决定能不能跑完
  • 多 Agent 系统上线前先定治理规则。 openJiuwen 把资源冲突与权限重叠做成平台能力,反过来说明这是真实高频故障;自建 Agent 平台时,这一层不要留到后面补。
  • 关注灵衢的开放协议定位。 如果它真的成为可无限扩展的开放总线标准,围绕它的互联生态(SSD、网卡、交换机)会出现新的适配机会;但协议细节与开放程度尚待公开文档确认。
  • 企业引入 AI 别只做「表面自动化」。 华为七步法的第一句是「理解核心商业逻辑、用专门评估方法选高价值生产场景」——这句话适用于所有不做 AI 基础设施的团队。

AI 之家 观点

  1. Peerium 是国产在计算底层架构层面少有的一次「范式级」尝试。 不管最后市场接受度如何,敢于把冯·诺依曼单机架构和主从架构同时列为突破对象,本身就说明华为判断「堆卡」这条路已经到头了。
  2. 「百万处理器成为一台计算机」要打折扣看。 100 万卡是结合多轨道拓扑的理论上限,51.2 万卡是二层 CLOS 四平面组网的上限,Atlas 950 实际部署规模是 25.6 万卡。引用时请用「已部署」的那个数字,别用「最大支持」。
  3. 昇腾 960 提前三/一个季度,是个需要验证的乐观信号。 芯片研发提前流片通常意味着良率或设计风险低于预期;但从「就绪」到「规模交付」之间还有一个产能爬坡,2027 Q1/Q3 这两个时点请以华为后续公告为准。
  4. 对国内 AI 基建的判断:算力供给正在从「卡不够」转向「电不够、光模块不够、可用度不够」。 华为这次的交代几乎全在这三件事上(功耗 -550kW、光模块砍九成、可用度 99.8%)——这是全行业共同的瓶颈,不只是华为的。
  5. 开源 openJiuwen 是差异化动作。 在闭源 Agent 平台扎堆的当下,用 Apache 类开源协议把企业级治理能力放出去,能换来的适配者比卖 license 多。具体协议条款待官方仓库确认。
  6. 别忽略时间表:灵衢昇腾 950 云服务 09-30 国内商用、11-30 全球商用——想先验证的团队,10 月就能上手;海外团队要等到 11 月底。

待核实:昇腾 960 的「提前三/一个季度」与 2027 Q1/Q3 时点为观察者网在 HC 2026 现场获悉的口径,非华为正式产品路线图;51.2 万卡 / 100 万卡为组网理论上限而非已交付规模;openJiuwen 的具体开源协议以其官方仓库为准;「外部开发者占比 61%」「月活 5200 名」为华为大会口径。

相关阅读

来源

本资讯由 AI 之家 编辑部基于公开报道整理,非厂商付费内容;产品参数与商用时间以华为官方公告为准,欢迎在 反馈邮箱 反馈更新。

相关对比

CodeBuddy vs 通义灵码:腾讯与阿里的 AI 编程助手怎么选(2026)

CodeBuddy(腾讯)与通义灵码(阿里)是国内两大厂的 AI 编程助手。一句话结论 + 决策树 + 价格对比:腾讯生态与本土工作流选 CodeBuddy,阿里云与通义模型选通义灵码。

Coze vs Dify:AI Agent 平台怎么选?零代码 vs 开源全控对比

Coze vs Dify 2026 选型对比:字节零代码 Bot 平台 vs 开源 LLMOps 全控平台,从平台定位、开发体验、工作流编排、RAG 精度、私有部署、价格模型和适合人群 7 个维度判断,帮你选对 AI Agent 平台。

Dify vs Flowise:LLM 应用开发平台怎么选(2026)

Dify 与 Flowise 都是可视化 LLM 应用开发平台。一句话结论 + 决策树 + 成本对比:要开箱即用的完整产品与中文生态选 Dify,要节点级自由编排与自部署选 Flowise。

Dify vs Langflow:开源 LLMOps 平台怎么选?业务全控 vs LangChain 工程对比

Dify vs Langflow 2026 选型对比:Apache 2.0 LLMOps 全平台 vs MIT 可视化 LangChain 画布,从平台定位、开发体验、工作流编排、RAG 能力、模型生态、私有部署、价格模型和适合人群 8 个维度判断,帮你选对开源 LLMOps 平台。

Dify vs Manus:Agent 平台 vs 通用 Agent 怎么选?2026 对比

Dify vs Manus 2026 选型对比:开源 LLMOps Agent 平台 vs Butterfly Effect 通用 AI Agent。从定位、核心能力、可定制性、开源、价格和适用场景 6 个维度帮你选对 Agent 工具。

Dify vs n8n:AI 工作流平台怎么选?LLMOps 全控 vs 通用自动化对比

Dify vs n8n 2026 选型对比:Apache 2.0 LLMOps 全平台 vs Sustainable Use License 通用自动化平台,从平台定位、工作流编排、RAG 能力、模型生态、集成数、私有部署、价格模型和适合人群 8 个维度判断,帮你选对 AI 工作流平台。

相关评测