![]()
文丨云潭
“单卡打不过,就把几千张卡焊成一台电脑”。
2026年秋天,当阿里和华为几乎同时亮出各自的“超节点”杀手锏,这个足以填平中国算力性能差异的技术创新,正掀开一场全新的AI叙事。
【换道竞争】
国产GPU正万象竞发,摩尔线程、沐曦股份、壁仞科技相继登陆资本市场,二级市场对国产算力的热情有目共睹。
但不可否认,国产AI芯片与英伟达、AMD高端产品仍有性能差异,这是不可回避的现实。
去年的华为全联接大会上,徐直军就坦言:“由于无法使用最先进制程,华为单颗芯片与英伟达存在差距。”
以昇腾910C为例,其单卡FP16算力最高800TFLOPS,约为英伟达H200的50%;华为最新一代昇腾960DT(预计2027年Q1交付),FP8算力2PFLOPS,基本追平H200,但仅为B300的1/3。而届时,英伟达可能又推出下一代产品,虽然国产芯片追赶速度很快,但中美芯片性能的代际差不容忽视。
![]()
另一端,进口通道也在持续收窄。目前,中国企业能稳定采购的是反复“阉割”的H20。而由于严苛的附加条件,性能更强的H200基本无人问津。
此时,超节点应运而生。既然“单卡打不过”,那就把几千张、上万张卡拼成“一台超级计算机”,这就是超节点的底层逻辑。
正如徐直军所说,华为通过“超节点+集群”的系统性创新,在整体算力上做到了全球领先。
超节点要解决的就是大模型训练与推理中最顽固的两个瓶颈。
一是“通信墙”,AI大模型沿Scaling Law(规模定律)加速演进,前沿模型参数规模已突破万亿级别,全球最大开源大模型Kimi K3参数规模约2.8万亿,Anthropic的Fable 5参数量在5万亿到10万亿之间。
![]()
性能更强的大模型依赖更庞大的算力,在万卡级集群中,受制于传统的网络连接,通信耗时能占到训练总时间的30%-50%,导致算力利用率(MFU)往往连30%都不到。因此,即便芯片再强大,也会被通信延时拖累。
二是“内存墙”,随着MoE等稀疏架构普及,模型参数动辄万亿、十万亿级,对显存容量与带宽的需求急剧放大。内存带宽/延迟的改善速度低于芯片性能增长的速度,导致计算单元被迫等待数据。在超大算力集群中,这一问题就会被大幅放大。
超节点给出的解决办法是“以系统补芯片性能”,把竞争从“单点能力”拉到“系统工程”。
9月17日,华为在全联接大会上发布全球首个采用NPO技术的超节点昇腾960,可扩展至4096卡;5天后的9月22日,云栖大会上,阿里拿出全球首款SNPO光互连超节点磐久AL64。此外,中科曙光、紫光股份、沐曦股份等企业也相继入局。
随着超节点加速落地,这种“拼工程、拼系统”的降维打击,让中国算力在先进制程受限的情况下,蹚出了一条通过系统级扩展提升整体算力的破局之路。
【物种进化】
构建大规模的GPU集群,有Scale-Out(横向扩展)和Scale-Up(纵向扩展)两种方式。
简而言之,Scale-Up即增加单节点的计算资源,Scale-Out则是增加节点的数量。往一台服务器里多塞几块GPU,就是Scale-Up。这时,一台服务器就是一个节点。把多台电脑(节点)连接起来,就是Scale-Out。
![]()
面对难以逾越的“内存墙”与“通信墙”,业界逐渐意识到,单靠芯片性能的抬升,无法促进算力集群能力的同等线性增长。
而超节点则扭转了传统Scale-Out(横向扩展)的架构模式,这种Scale-Up(纵向扩展)架构,将竞争维度从“单卡峰值算力”转向“系统级算力聚合效率”。
![]()
两种路线的分野是全方位的。Scale-Out是“多台独立物理服务器”,时延微秒级,单卡互联带宽几十到几百GB/s;Scale-Up是“一台超级计算机”,通过统一内存编址,时延压到百纳秒级(150~200纳秒),整机柜带宽可达数十甚至上百TB/s。
这样一来,带宽与延迟指数级改善,上述两堵墙被打破后,MFU(有效算力利用率)与Token生产效率也相应提升。
低延迟互联因此成为超节点的“灵魂”。
受限于空间、功耗和散热,单台服务器能塞进的GPU数量有限,而如果GPU互连存在卡点,那么Scale-Up就形同虚设。
面对这一问题,英伟达于2014年就推出自家私有的NVLINK总线协议,NVLINK目前已经迭代至第五代,并形成自己的闭环生态;华为拿出了灵衢(UnifiedBus)全对等架构,并率先采用NPO(近封装光学)技术。
不同于传统光模块把光引擎放在机箱面板的做法,NPO把光引擎贴近计算芯片部署。采用NPO后,超节点内部可承载TB/s级的超大互联带宽,通信时延压入百纳秒级,为国产算力的Scale-Up扩容提供了一条现实可行的路径。
![]()
昇腾960超节点就采用5500个Hi-ONE,替代原本需要的4万8千颗800G光模块,功耗还降低了超550千瓦,单引擎容量达7.2T,这也是目前传输能力最大的NPO产品。
而且,NPO还可复用国内现有光模块产业基础,无须重构供应链,这是AI芯片产业背景下,最契合中国算力产业的一条路径。
【放量元年】
如果说2025年是超节点的发布元年,那么2026年,将是超节点的“放量元年”。
落地节奏已经在提速。华为昇腾384超节点自2025年发布以来,已规模化部署超750套,覆盖互联网、运营商、金融、教育、医疗、制造等20多个行业;昇腾910C超节点累计部署超1000套,昇腾950超节点也已规模商用。
今年4月,中国移动2026-2027年人工智能超节点设备集中采购开标,明确指定华为CANN生态(河南昆仑+长江计算+华鲲振宇+宝德计算机+华启智慧),这是三大运营商首次在集团层面启动超节点集采,标志着运营商算力建设告别“通用服务器简单堆叠”,迈入“高性能超节点架构”的规模化部署时代。
中科曙光则与海光信息深度绑定,凭借超30年的系统集成经验,走出了一条“超智融合+开放生态”的差异化路线。
7月10日,国内首个全国产十万卡AI超集群曙光8000(登峰)正式落成,并同步接入国家超算互联网。
2026年WAIC期间,阿里云正式发布灵骏真武M890超节点,目前已在乌兰察布开放邀测,其一台超节点即可承载十万亿参数级MoE大模型的推理。阿里磐久AL128已开始规模部署验证。
此外,百度则推出天池256/512卡超节点,基于自有昆仑芯芯片,并已实现量产交付,完成对文心、DeepSeek、智谱、MiniMax等大模型的适配。字节跳动发布“大禹”超节点服务器,腾讯联合华勤技术打造ETH-X超节点。
有数据统计,目前在互联网厂商的算力采购中,超节点占比约三到四成,头部方案进入批量交付。随着客户验证与试点部署完成,超节点即将进入加速落地期。
超节点(SuperPod)最早由英伟达提出。黄仁勋早在2024年GTC上就表示:“NVIDIA DGX AI超级计算机,是AI工业革命的工厂,全新DGX SuperPOD让每家企业、每个行业、每个国家都能训练、生成属于自己的AI。”
但把超节点做到极限的,则是中国企业。
要知道,目前英伟达主流的NVL72超节点,单节点固定为72张GPU,这既是当前产品线的标准配置,也是功耗、散热和网络连接综合权衡下的阈值。
对比来看,华为超节点最大可扩展至8192卡(昇腾950超节点),单超节点计算性能约为英伟达的25-30倍,足以弥补单卡算力不足的劣势。
![]()
放眼全球,谷歌超节点最大规模为9216卡(Ironwood Pod),华为下一代超节点将升级至15488卡(960 SuperPoD,号称全球最强),架构弹性与组网容错性优于谷歌。
更关键的是节奏,昇腾950超节点已正式商用,2027年一季度昇腾960超节点上市,960PR提前一个季度至2027年Q3,其后还有昇腾970(2028年)、昇腾980(2029年)保持一年一迭代。
当全球AI竞赛进入白热化,一场改写赛道的“系统级突围”,正从中国超节点开始打响。
免责声明
本文涉及有关上市公司的内容,为作者依据上市公司根据其法定义务公开披露的信息(包括但不限于临时公告、定期报告和官方互动平台等)作出的个人分析与判断;文中的信息或意见不构成任何投资或其他商业建议,市值观察不对因采纳本文而产生的任何行动承担任何责任。