昇腾960超节点,一束光

发布时间:2026-09-28 17:16

  以前听到这句灵魂发问,小编想到的大多是奥特曼打小怪兽的热血梗;但谁能想到,2026 年,真有人把“光”玩成了颠覆算力江湖的终极武器。

  要问今年大会最受关注的,无疑是 9 月 17 日主议程上,华为副董事长、轮值董事长汪涛发表的题为“智启新未来,打造智能世界的硅基黑土地”的主题演讲。

  以及在演讲中,华为正式发布全球首个采用 NPO 技术的超节点 —— 昇腾 960 超节点,加速十万亿规模大模型的训练和推理。

  5500 个光引擎替代 4.8 万颗光模块,功耗直降 550 千瓦,系统可用度做到 99.8%…… 种种高光技术和亮眼数据,让现场惊呼声不断。

  所以,这究竟是一项怎样硬核的创新成果?为什么它又能被视作下一代 AI 基础设施的“终极武器”?

  数据显示,当前大模型参数已快速迈向 10 万亿,到 2030 年预计突破 100 万亿;智能体已经能按小时级连续工作,未来将以“月”为单位执行任务;中国每日推理 Token 已增长到 500 万亿左右,还将迈向百万万亿级。

  更直观的变化是,AI 正从尝鲜式的对话工具,变成能深入千行百业真正干活的 Agentic AI,人工智能从量变走向质变。

  但是,质变的另一面却是压力:Agentic AI 时代的算力基础设施,恰好卡在一组核心矛盾上,即一边要支持更大规模的 MoE 模型、更长的上下文序列、更低的推理时延,一边又必须显著降低推理成本。

  瓶颈具体卡在通信上:主流 MoE 模型的训练过程中,数万颗芯片需要对齐每一层、每一个环节的中间结果,华为的仿线 万卡服务器集群里,芯片间的通信代价超过了全部训练时间的 40%。

  华为马尔科夫实验室的数据更直观,4K 超节点组成的 10 万卡集群,MFU 比 8 卡服务器组成的同规模集群高出 2.75 倍。

  因此,解决之路也更显清晰:让多芯片紧密协同组成“超节点”,对算力基础设施做系统级的架构重构。

  这已经成为产业和学界的共识。比如今年 WAIC 期间,鹏城实验室和全球计算联盟牵头发布

  落地互联网、运营商、金融、教育、医疗、交通、制造等行业,也是国内唯一训练出 SOTA 模型的超节点。

  之前 WAIC 期间,昇腾 950 超节点的首次真机亮相,就已经引起过广泛关注。

  本次全联接大会上,首先是昇腾 950 超节点官宣迈入规模商用的新阶段。不过这只是一道开胃菜。

  这是业界首个具备量产能力的 NPO 产品,昇腾 960 超节点“全球首个采用 NPO 技术”的头衔,正是由 Hi-ONE 撑起来的。

  两者是一体两面,Hi-ONE 负责打通超节点内部的高速互联,昇腾 960 超节点则是这套技术长成的那台“超级计算机”。

  NPO 全称 Near-Packaged Optics,近封装光学,这个读起来有点拗口的技术是用来做什么的呢?

  我们知道,今天的大规模 AI 集群内部,主要靠铜缆做电互联,当 Serdes 速率达到 224G 甚至更高,铜缆的各类损耗会让信号传输质量急剧下降。

  打个比方,这就像在一条越来越拥挤的老路上跑车,路的名义宽度一直在加,车却越跑越慢,堵在路上的时间越来越长。

  NPO 作为与计算芯片近封装的光引擎,可以在距离芯片边缘几厘米的地方完成电信号到光信号的转换,突破铜缆传输距离与带宽的物理极限。

  互联功耗与时延显著降低,布线和散热的难题也顺带打包解决。相当于把磁悬浮修到了每个工位门口,通勤效率直接拉满。汪涛说得很直接,“从传统的可插拔模块走向 NPO 是必经之路”。

  汪涛在圆桌专访中引用了任正非经常说的一句话,华为的研发投资是“范弗利特弹药量,打破一个城墙口”。

  几十年攒下的光通信家底,集中砸向超节点互联这个城墙口,Hi-ONE 就是砸出来的结果。它与灵衢协议一起,构成了可规模扩展的超节点互联系统,华为还在全球光互联标准组织 OIF 提出了 NPO 标准立项建议,得到众多行业伙伴的积极响应。

  华为在会上宣布,昇腾 960 芯片研发进度超出预期,性能实现倍增。960DT 比原计划提前三个季度,2027 年第一季度就绪;960PR 比原计划提前一个季度,2027 年第三季度就绪。

  往后看,昇腾系列芯片将保持一年一代的演进节奏,2028 年、2029 年陆续推出昇腾 970、980,算力规格继续翻倍。

  它采用领先的正交架构和全液冷设计,基于灵衢实现内存统一编址,可扩展至 4096 卡规模,提供 8EFLOPS FP8、16EFLOPS FP4 的算力,HBM 容量高达 1PB。

  按照超节点白皮书定义,内存统一编址意味着:超节点内部任意一块芯片,都可以访问公共内存池。四千多张加速卡,逻辑上合并成为一台巨型计算机。刚好匹配十万亿参数大模型训练推理需求。

  5500 个 Hi‑ONE 光引擎,直接替代原本需要的 48000 颗 800G 光模块。整机功耗直接减少 550 千瓦,无故障运行时间翻倍,系统可用度高达 99.8%。

  汪涛在大会的圆桌专访中也透露,业界 10 万卡集群的 MFU 往往连 30% 都不到,意味着大量时间耗在故障和故障修复上;MFU 每提升 1 个百分点,10T 大模型的训练就能缩短三天。对动辄数月的大模型训练来说,可靠性就是实打实的时间和成本。

  汪涛对此看得很清醒,“要提供有竞争力的训练和推理系统,只做好一个芯片不够,只做一个整机和服务器也是不够的”,最终考验的是多学科的系统工程能力。

  包括鲲鹏超节点全新升级,基于灵衢全光组网最大支持 4096 节点,形成 256TB 统一内存池,十万级沙箱启动速度比传统服务器方案提升 30 倍,沙箱密度还能再提升 25%,Agent 向量检索效率实现倍增。

  多个昇腾 960 超节点通过灵衢网络或 RoCE 连接,二层 CLOS 四平面组网下最大集群规模可达 51.2 万卡,再结合多轨道拓扑技术,最大可支持 100 万卡昇腾超节点集群。

  看完硬件参数,相信大家已经感受到昇腾 960 超节点的冲击力。但它的意义,远不止一台性能强悍的机器。

  当下芯片工艺的前进脚步越来越难。昇腾给出一条新思路:靠超节点 + 集群架构创新,拔高算力上限。

  此前 NPO 更多停留在实验室和论文里,Hi-ONE 作为业界首个量产的 NPO 产品落地,加上华为在 OIF 推动标准立项,意味着光电融合的互联技术开始进入产业化阶段。

  对光模块厂商、设备商和数据中心建设者来说,这是一个明确的风向标 ——下一代 AI 基础设施的互联形态,正在被重新定义。

  汪涛反复强调,华为专注筑牢 AI 基础设施底座,坚持开源开放算力生态,拥抱国内百模千态的发展浪潮。

  CANN 已经全面开源常态化运营。社区外部开发者占比达到 61%,首次超过内部研发人员。月活跃开发者突破 5200 人,成长为国内活跃度顶尖的 AI 开源社区。

  昇腾已经适配 90 多个主流第三方开源社区,并且在 Linux 基金会支持下,正式登上 PyTorch 官网可直接安装的算力平台。这也是第一个登上 PyTorch 官网的中国算力平台。

  再加上鲲鹏生态 416 万全球开发者,7200 余家合作伙伴,昇腾联合伙伴孵化 7000 多套行业解决方案。

  回到汪涛演讲的题目,“打造智能世界的硅基黑土地”。黑土地自己不直接长出庄稼,它的价值在于让每一位耕种者都能有所收获。

  AI 时代的大幕才刚刚拉开。接下来,华为将和合作伙伴一起,助力客户把 AI 转化为每个行业、每个企业触手可及的生产力。对千行万业来说,这或许才是“硅基黑土地”最实实在在的许诺。

排行

精选