国联民生证券:AI算力向超节点演进 国产产业链迎来发展机遇

发布时间:2026-07-26 11:14

  国联民生证券发布研报称,大模型参数规模向万亿级别演进,驱动AI算力需求持续快速增长,建议重点关注:1)国产超节点龙头:浪潮信息、中科曙光等;2)华为超节点产业链:软通动力、神州数码、中国长城、慧博云通、拓维信息等;3)国产AI芯片/CPU:中国长城、寒武纪、海光信息、云天励飞、龙芯中科等。

  2026年5月,华为在IEEE ISCAS 2026上提出韬定律:当几何缩微逼近物理极限,半导体系统性能的提升路径从缩小晶体管转向压缩信号传播时延。这一逻辑可类比于超节点在AI算力层面的作用:大模型参数规模向万亿级别演进,算力瓶颈已不在单芯片,而在跨节点通信能力。超节点通过跨节点统一内存编址与硬件原生内存语义直访,将通信从软件路径转入硬件路径,使集群规模下算力利用率保持近线性扩展,将大模型算力的扩展重心从单芯片性能转向系统级通信效率,成为万亿级别大模型规模化运行的关键架构方向。

  超节点有望成为万亿参数大模型的核心算力底座。传统单芯片迭代+服务器横向堆叠的Scale-Out扩容路径已现双重瓶颈:一是先进制程演进边际收益递减,单芯片性能提升的成本持续抬升;二是分布式集群节点间地址空间独立,跨节点数据的传输需经过多层软件协议栈处理,通信开销随并行规模扩大呈非线性增长,大量算力在数据等待中被闲置,Scaling Law延续在架构层面受到约束。通信时延是决定大规模并行效率的核心变量,超节点通过降低跨节点通信的软件开销,实现大规模并行下的近线性性能提升,成为下一代AI算力的核心底座。

  超节点由多个物理计算节点通过专用高速协议连接,具备跨节点统一内存编址能力,逻辑上呈现单台计算机特征的紧耦合计算系统,核心是为大模型这类紧耦合并行负载提供垂直扩展的算力承载。与传统Scale-Out分布式集群相比,超节点从架构层面减小了跨节点通信的软件开销,提升了计算效率。

  大模型自回归推理存在Prefill与Decode两种资源需求冲突的阶段,超节点可以成为实现P/D分离的重要支撑,因此有望成为下一代AI算力架构的核心形态。在Decode阶段,决定性能的关键因素不再是GPU的峰值算力,而是其在单位时间内能够从显存中读取或写入数据的总量。这一性能直接影响着用户的另一个核心体验指标,即单Token生成延迟,它决定了后续文本生成的流畅度,进而P/D分离架构应运而生,新型的超节点服务器架构实现高效物理分离,凭借强大的内部互连网络,在内部进行P/D任务的划分。同时,在互联协议端,技术的进步可以更有效实现物理带宽能力的释放。以中国移动推动的OISA协议为例,新一代互连技术已经超越了单纯“数据管道”的角色,正在向系统管理中的主动参与者演进。

  超节点已在大模型预训练、推理、后训练、多模态等流程中验证出架构价值。根据

  后训练、多模态及Agentic AI场景进一步验证了超节点在大模型全生命周期中的架构延展性。后训练方面,强化学习需同时维护策略、价值、奖励及参考四个模型,参数与梯度同步通信量大,传统集群带宽瓶颈致训练效率下降40%~60%,超节点将模型传输时延从数十秒级降至毫秒级,70B模型RLHF训练中推理时延由数十秒降至秒级。多模态方面,T级参数模型的多任务负载对通信带宽与异构调度提出更高要求,超节点通过逻辑资源池化与内存语义小包超低时延通信提升分布式推理与3DGS重建效率。

  英伟达NVL72系列是全球超节点产品的标杆,从GB200到Vera Rubin,持续迭代并将超节点作为核心产品。

  浪潮信息:元脑SD200超节点率先完成Kimi K2.6、DeepSeek V4、GLM 5.2、MiniMax M3等主流大模型的高性能优化,在Kimi K2.6万亿参数大模型上实现Token生成时间4.77ms,首Token延迟降低35%,为Agent场景应用的高效运行提供算力支撑。元脑SD200采用多主机低延迟内存语义通信架构,基于开放总线交换技术,在单机内实现64路本土GPU芯片统一寻址与高速互连,依托百纳秒级低延迟链路降低通信与显存访问开销。

  华为:国内超节点核心引领者,万卡级统一架构落地。华为是国内超节点技术的核心引领者,已构建覆盖智算、通算、混合场景的完整超节点产品矩阵,通过自研全栈光互联技术突破万卡级统一架构瓶颈,是国内具备万卡级超节点落地能力的厂商。当前Atlas 900超节点已实现规模化部署,后续Atlas 950/960将沿规模扩张路径持续迭代,单超节点规模从384卡提升至1.5万卡级,算力实现百倍级跃升;同时华为将超节点技术延伸至通用计算领域,推出通用计算超节点TaiShan 950。

  中科曙光:无线缆架构创新,单机柜算力密度较高。中科曙光推出的超节点产品聚焦高密度Scale-Up纵向聚合,以无线缆正交架构为核心差异化,已形成X640与X40两大产品形态。

  曙光X640:单机柜级640卡超节点千卡级计算单元。采用一拖二高密架构,实现单机柜640卡超高速总线互连,构建大规模、高带宽、低时延超节点通信域。双scaleX640超节点组成1,280卡计算单元,柜间通过高速网络互连。MoE大模型训练效率与高通量推理吞吐性能提升30%-40%。采用超高速正交架构,融合超高密度刀片、浸没相变液冷、高压直流供电等多技术创新,单机柜算力密度相比业界其他超节点最大提升20倍,PUE值低至1.04。基于AI计算开放架构设计,适配支持多品牌AI加速卡,兼容主流AI计算软件生态,适配优化400+主流大模型。

  曙光X40:首个无线缆箱式超节点。面向万亿参数超大语言模型、多模态大模型的训练、微调、离线推理场景,解决传统多机8卡集群线缆繁杂、部署周期长、卡间通信瓶颈、运维故障率高的行业痛点。

排行

精选