半岛体育官网

半岛体育官网以深度数据分析,助力用户洞察赛场为核心,带来高效便捷的体验。

在2026世界人工智能大会(WAIC)的主展区上海世博展览馆,几排高达两三米、通体黑色的机柜吸引了众多参观者的目光。人们对这些庞然大物的内部构造充满好奇,纷纷探究其搭载的GPU数量、液冷管路设计以及高速线缆的布局,并追问其算力究竟能支撑何种应用。华为Atlas 950 SuperPoD、中兴OEX、阿里云真武M890×磐久AL128等超节点产品,成为了展会上的焦点,这与它们一年前尚属新兴概念的定位形成鲜明对比。

《IT时报》记者在为期四天的展会中,走访了多家参与超节点研发的芯片及设备厂商,试图探寻这一转变背后的原因:为何曾经的小众概念,如今已成为国产算力领域共同追逐的方向?

殊途同归:国产算力聚焦超节点

相较于去年的WAIC,今年的大会显示出超节点已成为国产算力行业普遍认同的趋势。从华为、壁仞、燧原、中兴通讯、沐曦股份,到中科曙光、阿里云、百度智能云,几乎所有国内算力厂商都将超节点置于展台的核心位置。这与WAIC所传递出的信息一致:全球AI竞争的焦点正转向基础设施,而超节点作为关键一环,由此获得前所未有的关注。

尽管目标一致,各家在技术路径上却呈现出多样化。

华为采取了一体化策略,其首次公开展示的昇腾950超节点(Atlas 950 SuperPoD)集成了1024张计算卡,拥有256TB统一内存,NPU往返时延低至3微秒。通过统一内存寻址,这1024张计算卡能够如同一个整体般协同工作。这套设备占据了展墙的大部分空间,宛如一堵“算力墙”。据介绍,昇腾950超节点最高可支持8192颗芯片互联,未来更有望扩展至超过50万卡的集群。

与华为的封闭体系不同,中兴通讯选择了更为开放的道路。其OEX架构兼容CPU、GPU、交换芯片、网卡等多种硬件,并携手壁仞科技、沐曦股份、燧原科技、天数智芯等国产芯片企业,共同构建开放的国产超节点基础平台。此举旨在让用户能够根据具体业务需求自由组合芯片,从而优化整体拥有成本(TCO)。

壁仞科技则将重点放在提升互联能力上。其自主研发的BLink2.0互连协议,使得1024张GPU能够共享同一内存空间,形成一个可统一调度的“逻辑GPU”,从而在大规模上支持模型训练与推理。壁仞还提出了“NPO光互连、分布式解耦架构”,意图克服传统铜互连在带宽、时延和距离方面的局限。

随着AI产业重心从训练逐步转向推理,TPU(张量处理器)也成为超节点竞争中的一个重要选项。作为国内TPU的代表企业,中昊芯英发布了新一代“须臾”AI芯片,其混合精度浮点算力达到896TFLOPS,8位推理算力为1792TOPS,相较于同类产品,单芯片功耗降低约50%。凭借TPU原生为AI计算设计的架构,单个超节点最多可支持2048颗芯片直连,足以支撑万亿参数大模型的训练、多智能体协同以及大规模推理任务。中昊芯英创始人杨龚轶凡指出,源于图形渲染的GPU在底层架构上互联能力并非最优,而TPU从设计之初就围绕大模型训练和海量神经网络并行计算,因此更适合构建超节点并易于扩展至万卡级别。

云计算厂商同样将超节点视为AI基础设施的关键组成部分。阿里云展示了由真武M890芯片和磐久AL128超节点构成的算力系统。真武M890采用平头哥自主研发的并行计算架构,配备144GB高带宽显存,片间互联带宽高达800GB/s,能够同时满足大模型训练、推理以及智能体应用的需求。百度则展示了基于昆仑芯P800的天池算力矩阵,支持256卡超节点,并可扩展至数十万卡集群,兼容文心、DeepSeek、智谱、MiniMax等主流模型。

尽管呈现出百花齐放的态势,今年WAIC清晰地传递出一个信号:国产算力竞争的重心已从单颗芯片转向整个计算系统。

模型迭代驱动超节点需求

今年为何几乎所有企业都将目光投向超节点?答案并非来自展馆,而是源于模型本身的演进。壁仞科技AI框架副总裁、AI软件首席架构师丁云帆表示:“超节点并非全新概念,而是大模型发展到当前阶段的必然产物。”

在全球大模型以三个月为周期快速迭代的背景下,国产算力的竞争逻辑正在发生转变。受限于制程工艺,国产GPU在单芯片算力方面与国际先进水平仍存在3至5年的差距,短期内通过单颗芯片实现跨越式赶超并非易事。

与此同时,Agentic AI时代的到来,使得大模型出现了三个显著变化,每一个都加剧了对超节点的需求。

首先,MoE(专家混合)架构日益成为主流,叠加Agent技术的蓬勃发展。过去,大模型更像一个整体,每次推理调用全部参数;如今,越来越多的模型采用MoE架构,根据任务动态调用不同的“专家”网络。计算效率虽有提升,但GPU间的数据交换量却急剧增加。“专家并行需要极高的互联带宽,如果GPU间的通信速度跟不上,即使芯片性能再强也无法充分发挥。”丁云帆解释道。

其次,模型参数规模持续增大。曾经千亿参数已算大模型,如今万亿参数正成为新的标杆。例如,7月16日发布的Kimi K3,参数规模高达2.8万亿,是当前全球参数规模最大的开源模型。业内普遍预测,未来几年将出现5万亿参数级别的模型,这将进一步推高对单一集群算力的需求。

最后,上下文长度显著延长。代码Agent、科研Agent等新兴应用不断涌现,单次任务处理的Token数量呈指数级增长。输入的资料、生成的代码层层累加,对显存和算力的占用已远超以往。

一方面是单芯片算力提升的天花板难以突破,另一方面是用户对模型能力不断提升的期待,因此,“超节点已成为一项刚性需求。”丁云帆总结道。

光互连:2028年或成主流

然而,当算力的衡量标准从单颗芯片的峰值性能转向整个系统能够调动的有效算力时,真正的挑战隐藏在机柜之中。当1024张GPU构成一个超节点后,决定算力上限的关键在于互联带宽、网络架构、软件调度以及系统协同能力。换言之,能否将一批芯片高效地整合为一个整体,比单颗芯片的速度更为重要。

但这同时也意味着构建整个系统的难度呈指数级增长,尤其当超节点内的GPU数量从百级跃升至千级甚至万级时,通信成为最大的瓶颈。

过去几十年,GPU间的通信主要依赖铜缆传输电信号。但随着800G、1.6T高速互联时代的到来,电信号的传输距离缩短,功耗不断攀升,铜互连正逼近物理极限。“铜缆已难以满足未来超节点的需求。”一位现场技术人员表示。

解决方案在于用光信号替代电信号。目前光互连主要有四种技术路线:传统可插拔(FRO)、线性直驱(LPO)、近封装光学(NPO)和共封装光学(CPO)。丁云帆指出,今年以来,产业界的讨论焦点已从成熟的FRO和LPO转向代表未来方向的NPO和CPO,特别是NPO,正成为产业链协同攻关的核心。

相较于传统可插拔光模块,NPO将光引擎置于GPU或交换芯片附近,大幅缩短了电信号传输距离,并省去了高功耗的DSP(数字信号处理器)芯片,在带宽、时延、功耗和成本之间取得了更好的平衡,同时还能将传输距离扩展至数百米,这更适合未来大规模超节点的需求。

根据集邦咨询的数据,CPO/NPO市场规模预计将从2025年的约1亿美元,激增至2030年的390亿美元以上,这预示着一个五年内增长约400倍的巨大市场。阿里巴巴、腾讯等企业已将NPO视为中近期的重点部署方向。

因此,在今年的WAIC上,记者注意到,无论是光模块厂商、交换机厂商,还是其他产业链企业,都纷纷展示NPO相关产品、解决方案,或至少明确了相应的技术路线。尽管许多产品仍处于研发阶段,但整个产业已进入协同推进的阶段。

丁云帆认为,从技术角度看,国内已具备研发NPO相关产品的基本能力,不存在难以逾越的技术障碍。真正需要的是研发周期和工程验证,预计未来一两年内,相关产品将陆续推出并进入实际落地验证阶段。

但在CPO方面,国内布局的企业相对较少。一方面,CPO要求将光引擎直接封装到计算芯片内部,对芯片设计、先进封装和工艺制造提出了更高要求,整体技术难度远高于NPO,国内在部分先进工艺上与国际领先水平尚存差距。另一方面,产业分工模式存在差异。如果像英伟达一样将计算芯片与光互连集成于一颗芯片,原本属于光模块厂商的价值空间将被芯片厂商占据,这意味着产业链利益的重新分配。

“中国现阶段更适合走生态共建的路线。”丁云帆强调,在NPO架构下,GPU厂商、交换机厂商、光模块厂商等均可发挥自身优势,在产业链中找到定位,共同分享产业发展的红利。这种产业生态反而更为健康,也更有利于整个国产AI算力产业的持续发展。

目前,行业仍处于技术攻关和样机验证阶段。壁仞计划在明年推出基于NPO的超节点产品,并逐步推向实际生产环境。随着产业链的逐步成熟,预计到2028年前后,NPO光互连有望成为AI超节点的主流解决方案。

规模化:中国加速前行

如果说通信和光互连是超节点的“内在品质”,那么真正决定其发展深度和广度的,则是另一个高频词——工程化。本届WAIC上,无论是智能体工厂、大模型厂商,还是科研智能平台,在被问及最大挑战时,“系统工程”几乎都是不可回避的答案。

杨龚轶凡举例说明:当海量芯片组成统一集群并同时承载多家客户的业务时,如何降低分布式计算中的数据交换开销,是超节点需要解决的核心问题。与此同时,多租户场景下的数据隔离与隐私保护、万卡集群带来的散热压力,以及分布式调度、集群运维、故障自愈等软件能力,也亟待突破。

“超节点的竞争,本质上是一场产业链的较量。”杨龚轶凡表示,决定超节点能力的,不仅是芯片性能,更取决于网络互联、散热、软件调度等系统能力,以及产业链上下游的协同水平。封装、交换机、光模块、液冷、服务器、调度软件……这些过去分散在不同环节的技术,如今因超节点被紧密地联系在一起。

值得注意的是,丁云帆认为,在超节点的规模化扩展方面,国内甚至比国外走得更快。正是因为单卡算力存在差距,国内产业界才更迫切地寻求通过系统级创新来解决问题。这不是一次孤立的技术突破,而是一场体系化的突围。

这也是杨龚轶凡坚定选择TPU路线的原因之一:TPU作为专用架构,所需适配的算子远少于通用GPU,这为本土厂商提供了在特定领域快速追赶、实现“换道超车”的机会。

为期四天的展会落下帷幕,这些黑色的“算力墙”定格在许多人的手机相册中。或许,多年之后,这些照片将成为中国AI发展史上弥足珍贵的起点。

3条评论

在提供实时比分与海量赛事新闻方面,半岛体育官网提供贴心周到的支持。1月01日,

半岛体育官网围绕半岛体育登录入口不断创新,回应用户的真实需求。

精选半岛体育全站内容,半岛体育官网与你一同发现更多精彩。1月01日,

半岛体育官网专注半岛体育官网,为用户提供专业可靠的体验。

半岛体育官网专注半岛体育官网,为用户提供专业可靠的体验。1月01日,

围绕半岛体育APP,半岛体育官网持续打磨更优质的服务。

围绕半岛体育APP,半岛体育官网持续打磨更优质的服务。