华为这次最值得看的,可能不是昇腾 960 芯片。
“5500 个光引擎,可以替代 48000 个 800G 光模块”。在刚刚过去的华为全联接大会 2026 上,这组数字比单卡性能参数更让我们讶异,它来自昇腾 960 超节点的方案对比。华为给出的数据是:功耗降低超过 550kW,系统无故障运行时间翻倍!
做大规模计算,最让我们头疼的往往不是某张卡算得不够快,而是卡已经够快了,整个系统却没能跟上。
数据没到,要等。其他节点没完成同步,也要等。卡越贵,这种等待越让人崩溃。
9 月 17 日,华为正式发布昇腾 960 超节点,是全球首个采用 NPO 技术的超节点,支持 4096 卡,主要面向十万亿参数规模大模型的训练和推理。
本次发布会,灵衢、11 颗关键芯片、Hi-ONE 光引擎,以及一同升级的鲲鹏超节点,都值得我们拆开一看。它们要处理的事情很具体:这么多计算资源,放在一起到底怎么工作?
今天,现在的超节点很容易被人误解成一个规模特别大的集群。
按照华为给出的定义,超节点通过高效互联将多个物理计算节点紧密连接,支持跨物理节点统一内存编址,在逻辑上的确具备“一台计算机”的特征。设备还是那些设备,但软件看到和使用资源的方式变了。
目前,华为在传统服务器架构下,集群内通信可占到训练时间的 40%以上。这个比例不能套用到每个训练任务上,但通信开销确实是扩大集群时需要解决的问题,主要是单卡算得更快,多卡任务并不是按比例加速。
华为马尔科夫实验室做过一项仿真实验:同样是十万卡,由 4K 超节点组成的集群,与由 8 卡服务器组成的集群相比,模型浮点算力利用率(MFU)提升了 2.75 倍。
这个结果足以解释华为为什么愿意花这么大力气改架构。提升算力利用率,意味着在已有计算资源中挖出更多实际产出,而对十万卡级系统而言,这是一笔大开支。
灵衢 UnifiedBus 承担的是其中最基础的工作。华为的设计思路是,以统一协议连接不同组件,支持跨物理服务器的内存访问,减少协议转换开销。围绕灵衢,华为打造了 11 颗关键芯片,可覆盖计算、互联、管理等关键能力。
这可就不是在计算芯片旁边“配点东西”了。
我们过去谈芯片竞争,大家习惯比较制程、算力和带宽,而到了今天的“超节点”,很多原本不太受关注的组件也进入了主战场,这就导致了某个环节多一次转换、多一点等待,都可能让上游昂贵的计算资源闲下来。而统一编址也不是魔法,它不会抹掉物理距离,更不会让所有访问都一样快。因此,协议之外,华为还得处理连接本身。
光引擎为什么非要往芯片旁边挪?
NPO,Near-Packaged Optics,近封装光学。这是昇腾 960 超节点此次最值得展开说说的技术变化。
先来看它做的重要调整,这一次华为把光引擎放到了更靠近主芯片封装的位置,缩短了高速电信号需要经过的路径。值得一提的是,高速电信号不是跑多远都一样,它的路径越长,损耗、信号完整性和功耗等问题越难处理。如果传输速率继续往上走,工程上的妥协也会越来越多。
而在今天,NPO 试图把一部分距离交给光来完成。
但做成产品是另一回事。
光引擎靠近主芯片,导致布局和热设计会更紧张;性能要提高,可靠性也不能丢。华为介绍 Hi-ONE 时,专门提到了光、机、电、磁、热等要素的均衡设计,因为它们确实是必须同时处理的约束。Hi-ONE 单引擎传输容量达到 7.2T,采用的是内置光源,它与灵衢配合,构成了昇腾 960 超节点的互联基础。
48000 个光模块的“替代品”改变了什么
用 5500 个 Hi-ONE 替代它们,不能只简单的理解为部件数量变少,要知道连接结构一旦发生改变,功耗分布、散热压力、可靠性设计,都要跟着变,华为公布的超过 550kW 功耗降低和无故障运行时间翻倍,价值就在这些地方。
另外,昇腾 960 超节点采用正交架构、全液冷设计,最大的提供了 8 EFLOPS FP8 算力,说起来,真正到了这个规模,芯片、互联和散热已经很难各做各的,进行“各自为战”,而华为的链路优势也恰好在这里完美闭环,华为做计算,也做光通信。如今,光通信不只是负责把设备连上网,而是深入超节点内部,参与决定计算资源能发挥的作用。这比孤立地看一个 NPO 指标更有价值,不同技术线的积累也终于在同一套产品中相遇。
按照目前披露的计划,昇腾 960DT 将于 2027 年第一季度就绪,960PR 将于第三季度就绪。
鲲鹏为什么也要做 4096 节点?
这个问题乍看离大模型训练有点远,我们放到 Agent 上看一下。模型生成了一段代码后,接下来得有地方运行,装依赖、读文件、调工具缺一不可。这个流程中间一旦执行失败,还得需要拿到错误信息再交回模型处理,一次完整任务的落地,往往就在这些环节里来来回回的跑。在其中,不少工作是靠 CPU 完成的,但 CPU 的推理速度再快,如果执行环境迟迟起不来,用户看到的照样是“等待中”。
而此次升级的鲲鹏超节点基于灵衢全光组网,最大支持 4096 节点,可以解决这个问题。其给出的一个应用方向是 Agent 沙箱,在十万级沙箱启动场景对比中,鲲鹏超节点相较传统服务器方案可以实现 30 倍启动性能提升,沙箱密度提升 25%。
或许今天对普通应用团队来说,十万级沙箱还很遥远。也不是说今天你做一个 Agent 就必须配一套超节点。但当少量 Agent 运行时,启动环境慢一点,可能只是体验问题;但当任务大量并发,环境供给、调度和资源密度就必然会影响到整个平台的吞吐。
模型训练把 AI 加速卡推到了聚光灯下,真正到了 Agent 执行阶段,通用计算的压力也会重新浮出来。
提前布局,才是鲲鹏超节点出现在这场发布里的主要意义。
“易用”这两个字,得让开发者来评
CANN 的变化不能略过。
企业做平台选型,问的问题通常会及其朴素:我们这个模型能不能跑?要改多少代码?性能差在哪里,查不查得出来?出了问题,谁能解决?
上面任何一个问题拖上两周,研发团队对平台的评价都会变。
CANN 已全面开源开放,进入常态化开源社区运作,从“可用”走向“易用”,华为同时给出了“昇腾已跨越生态拐点”的判断。
目前,CANN 外部开发者占比达到 61%,首次超过内部开发者。社区月活开发者超过 5200 名。数据是最好的说明,外部开发正的认可让平台建设不再只是厂商自己的事,来自不同模型、框架和业务现场的问题,可以被直接带进社区,并在修改和优化后被更多团队复用。
华为披露,基于昇腾与 CANN 原生训练的模型已超过 40 个,昇腾覆盖了 PyTorch、Triton、vLLM、veRL 等 90 多个主流第三方社区。相比单纯增加一份支持列表,这些适配能否进入开发者日常使用的版本,能否持续维护,更决定“易用”的成色。
工程功夫的兑现,藏在无数细节里
看完这场发布,或许我更愿意把华为的实力理解为一种工程跨度:从芯片延伸到光引擎,从互联协议深入系统设计……处理开发框架与工具链。任何一条线拿出来都不轻松,而更难的是把它们做在一起,并且持续往前不断推进。
昇腾 960 接下来仍要经历产品就绪与应用验证,大型系统终究要到负载里见真章,但此次发布已经让人看到,华为正在尝试解决的,并不是某一代芯片的性能问题。一个 4096 卡系统背后,是成千上万处具体的工程选择。信号走哪条路?热从哪里带走?软件怎样调用资源?智能计算的雄心,最终都要落到无数细节中。
而只有能把这些细节做好,才有资格谈更大的未来。





