决定胜负的已不只是“性能”

AI超级计算机的竞争长期以来都用“有多快”(FLOPS,即运算性能)来描述。但到2026年,另一条轴也开始并列出现:为了实现这些性能,需要多少电力,也就是电力与效率。即使运算性能不断堆高,如果可供电力和电网跟不上,计算能力也无法继续增长。电力正在决定计算能力上限。这一转变,在超算最前线提前反映了数据中心约束从半导体转向电力基础设施的趋势。

首位靠“效率”拿下:LineShine

2026年6月TOP500最具象征性的变化,是首位易主。中国LineShine以2.198 exaflops登上TOP500首位。突出之处在于实现方式:功耗42.2MW,电力效率52.07 Gigaflops/Watt,而且是不搭载GPU的CPU-only设计。LineShine的HPL-MxP性能仅为HPL的3.6倍,支持其无GPU设计判断,因为GPU系统通常更容易显示出更高倍数。

形成对照的是第二名。美国El Capitan采用AMD EPYC和Instinct MI300A构成,达到1.809EF。这是主流解法:大量堆叠GPU,追求绝对性能。LineShine则展示了以单位性能耗电,也就是效率取胜的路径。当电力成为稀缺资源,绝对性能(FLOPS)之外,每瓦能产生多少计算也会左右竞争力。效率不是单纯的环保指标,而是在有限电力额度内获得更多计算的现实收益。

规模走向“superfactory”:Microsoft Fairwater

效率之外,绝对规模还在继续膨胀。Microsoft Fairwater Atlanta(2025年10月投运)目标是成为在数周内完成AI训练任务的分布式AI superfactory。其内部规模不同于传统站点。Fairwater网络连接数十万GPU、EB级存储和数百万CPU核心,而Atlanta采用NVIDIA GB200 NVL72(Blackwell)。站点之间通过为AI WAN部署的12万英里专用光纤连接。设施也采用两层设计以提高GPU密度并降低延迟。

规模越大,电力、冷却和水等资源约束就越靠前。具有象征意义的是,Fairwater Atlanta初期冷却水量被描述为相当于20户住宅一年的用水量。持续运行数十万GPU级系统,本身就是电力和基础设施保障问题。计算能力上限开始不再由能采购多少GPU决定,而是由支撑这些GPU的电力、冷却、用地和电网接入决定。

竞争正在全球并行

这并不是单一国家的故事。TOP500显示,exascale系统首次同时出现在亚洲、北美和欧洲三大区域。欧洲也凭借首台exascale机器JUPITER Booster正好达到1.000 exaflops。制度层面,EU正在建设19个AI工厂和13个天线节点,并向SME和初创企业免费提供。新增AI工厂设在捷克、立陶宛、荷兰、西班牙、波兰和罗马尼亚六国,而天线节点还包括瑞士、塞尔维亚等非EU国家。AI工厂是以AI优化超级计算机为核心的大规模模型开发基础设施,各区域都在一边确保电力和基础设施,一边追加计算能力。

从FLOPS到电力与效率:数字中的转变
01

首位靠效率取得

中国LineShine以2.198EF居首。42.2MW、CPU-only,效率52.07GF/W。HPL-MxP仅为HPL的3.6倍,支持无GPU设计判断。

02

主流解法仍是GPU

第二名美国El Capitan采用EPYC和MI300A达到1.809EF,是堆叠绝对性能的解法。与以效率突围的LineShine形成对照。

03

规模走向superfactory

Microsoft Fairwater连接数十万GPU、EB级存储和数百万CPU。初期冷却水约等于20户住宅一年用水量,规模本身成为资源约束。

04

全球同步推进

exascale首次同时部署在亚洲、北美和欧洲。欧洲JUPITER达到1.0EF。EU建设19个AI工厂和13个天线节点。

对业务的影响和确认点

如果涉及AI数据中心或高性能计算,需要确认:1. 计划是否不仅用“性能(FLOPS)”,也用“电力容量与效率(单位性能耗电)”来评估;2. 是否能保障支撑数十万GPU规模的电力、冷却、水、用地和电网接入;3. 采购与设计是否从效率角度优化,包括电源效率、冷却、高压供电和SiC/GaN采用;4. 如何接入本地区AI基础设施(AI工厂等)。AI计算能力已不再只由GPU数量决定。可获得的电力,以及使用电力的效率,正在成为下一条竞争轴。电源架构和冷却设计将在相关文章中讨论。

参考FactCard