万维读者网>世界军事论坛>帖子
HC归来,华为正重新定义AIDC基础设施
送交者: 员外 2026-09-28 17:42:42 于 [世界军事论坛]
杰西卡 发自 凹非寺

量子位 | 公众号 QbitAI

一座AI数据中心什么时候能投产,有时要先看电网的时间表。

国际能源署(IEA)在2025年的报告中曾警示,如果电网相关风险得不到解决,约20%的规划数据中心项目可能面临延误。对于已经投入大量资金采购计算设备的企业,等待接电也意味着等待业务上线。

可接上电之后,新的问题还在机房里。高密度设备需要更大的供电容量,计算任务带来快速变化的功率需求,产生的热量也必须及时排走。

供电、散热和交付中的任何一个环节,都可能影响新增硬件发挥作用。

AI算力扩张,由此把一个问题推到台前:怎样将可获得的电力,持续、稳定地转化为有效计算?

对此,巨头们已开始新的动作。

9月16日,英伟达、Google和Emerald AI宣布成立AI能源管理联盟(AEMA),推动数据中心根据电网运行状态动态调整用电,让大型算力设施成为更灵活的电网资源。

一天后,在华为全联接大会2026同期举办的AIDC基础设施峰会上,华为介绍了源网荷储AIDC 1.0解决方案,以及供电、储能和液冷领域的最新进展。

沿着电网、园区、机房到芯片的链路,这些动作共同回应的是能源与算力如何协同设计的问题。

能源与算力之间的这段距离,正在成为AI基础设施新的竞争焦点。

算力要扩张,先让电力跟得上

毋庸置疑,AI对能源的需求正在快速增长。

国际能源署(IEA)在2026年的报告中预计,全球数据中心用电量将从2025年的485TWh增至2030年的950TWh,接近翻倍;其中,面向AI的数据中心用电量同期预计增至约三倍。

但对具体项目而言,比全球用电总量更紧迫的,是当地何时能够提供足够的电,以及这些电能以怎样的质量持续供应。

服务器采购、机房施工、电网扩建和新增电源,往往遵循着不同的时间表。计算设备进入交付时,配套电力设施可能还在等待审批或建设。如果两者衔接不好,投资回收和业务上线就会随之推迟。

因此,能源需要更早进入算力规划。比如在新能源资源富集地区,将风光项目与AIDC协同布局,可以为算力提供更多能源选择。

政策也在跟进,将能源条件更明确地纳入AIDC的规划和建设要求。

今年8月,西班牙公布数据中心监管皇家法令草案,对功率不低于1MW的新接网数据中心提出了更严格的可再生能源要求:

每运行一小时,至少80%的用电须由新增可再生能源在同一小时覆盖;每新增1MW电力需求,须配套1MW新增可再生发电装机,相关装机应在数据中心投运前18个月建成,可自建,也可签订长期购电协议。

因此,仅购买存量绿电的绿证,无法满足这一新增装机要求。

草案还提出,不合规项目可能面临附加费、网络费率上调,持续违规甚至可能失去电网接入资格。

这份草案更值得关注的是逐小时匹配。按其提出的标准,年度总量达标并不足够,数据中心还需要更直接地考虑自身每一时段的电源结构。

中国也在推进算力与能源协同。

2026年4月,国家发展改革委、国家能源局、工业和信息化部、国家数据局联合印发《关于促进人工智能与能源双向赋能的行动方案》(国能发科技〔2026〕34号),并于5月公开发布,部署29项重点任务,明确鼓励算力设施配置构网型储能,支持具备灵活调节能力的算力设施开展绿电直连。

此前有关政策,也已提出国家枢纽节点新建数据中心绿电占比超过80%的目标,后续消纳政策也进一步纳入相关绿色电力消费比例要求。

欧盟则已基于《授权条例(EU)2024/1364》建立数据中心可持续性信息披露框架。9月21日,欧盟委员会进一步通过统一的数据中心可持续性评级方案,首批评级标签预计于2027年推出;最低能效标准也已进入咨询和立法准备阶段。

不同地区的规则与实施阶段各有差异,但能源结构、用能效率与运行数据,正在成为AIDC规划和运营中更具体的考量。西班牙草案提出的逐小时匹配,则进一步触及了绿电供应与计算需求在时间上的协同。

回到项目运行,即使新能源资源就在附近,也要处理时间上的错配。光伏随日照变化,风电也有出力波动,计算任务却有自己的执行节奏。

年度采购了足够绿电,与每个小时都能获得稳定的电力,其实是两件不同的事。这需要储能、支撑电源和电网共同配合——有的装置负责短时缓冲,有的承担更长时间的供需调节。

△AI生成

与此同时,AIDC自身的用电方式也在变化。

大规模AI集群里,大量设备会随着任务推进,共同进入计算、通信或等待阶段。功率同步变化时,供电系统面对的考验就不只是总容量够不够,还包括应对快速波动的能力。

两座全年耗电量相同的数据中心,如果一座负载较平稳,另一座频繁出现大幅功率变化,对供电控制和储能的要求就可能不同。

这正是“源网荷储”需要放在一起考虑的原因:

“源”对应电源,“网”负责连接与输送,“荷”包括服务器等用电设备,“储”提供备电与调节能力。

四者协同,需要同时考虑上游能提供怎样的电、下游怎样用电,以及供需不匹配时如何缓冲。

算力负载本身也有一定调节空间。

Google今年3月披露,已将合计1GW的需求响应容量纳入与美国多家公用事业公司的长期能源合同,通过限制或转移部分机器学习任务配合电网运行。

这类实践说明,在满足业务约束的前提下,部分计算任务可以根据电力供应情况调整执行时间,数据中心由此成为能够响应电网需求的资源。

这种调节首先要满足业务要求。实时推理有响应时延约束,训练任务也有完成期限,能够移动多少负载、维持多久,需要结合设备利用率、电价和储能成本共同计算。

机房内部还有另一重约束——密度。

相同电压下,设备功率越高,电流越大,线缆、连接器和配电空间面临的压力也越大。提高供电电压是减轻压力的一条路径,采用合适的直流架构还能减少部分电能转换环节。

800V直流也由此受到行业关注。

英伟达、Google、Microsoft等厂商也在开放计算项目(OCP)框架下推进800VDC标准,已吸引80余家设备与基础设施公司参与生态开发。

换句话说,800V直流更接近一次供电架构的分层演进。

不同代际的设备和机房会长期共存,供电系统必须给这段过渡留下余地。

供电容量提升的同时,热量还必须在有限空间内被带走;局部散热不足,会影响芯片性能乃至任务连续性。

电力获取、功率波动、高密散热与建设交付,由此形成一条相互影响的链路。要让新一批计算设备按时上线,这些环节必须更早围绕同一套运行需求展开设计。

这一共识,恰恰也在推动基础设施厂商重构AIDC的技术路线。

让算电协同深入每一层设备

在这些厂商中,华为的布局较为系统。今年5月,华为发布了源网荷储AIDC战略,将重构方向概括为“3+1”:供电链路的Watt、热管理的Heat、数字化运营的Bit,以及建设模式。

到了9月的峰会,AIDC 1.0与一系列产品进展,进一步说明了这条路线怎样落到当前的产业条件中。

这套重构的背后,是AIDC与电网关系正在发生的变化。

华为数字能源副总裁何波,曾将这一关系的演进概括为三个阶段:从“适应电网”,到“支撑电网”,再到“主动构网”。

△华为数字能源副总裁何波

第一阶段,数据中心主要是用电负荷,重点是配置UPS、备用电源和电池系统,在电网异常时保障服务器稳定运行,储能的价值主要体现在备电。

第二阶段,储能从单一备电转向备电与调节并重,AIDC可以参与削峰填谷、需量控制、短时波动平抑和需求响应。前面提到的Google 1GW需求响应,也体现了数据中心参与电网调节的方向。

第三阶段,则通过构网型储能、能源路由器和微电网控制技术,增强电压与频率支撑能力,并在具备相应配置和控制条件时支持孤岛运行。

这不意味着每一座AIDC都要变成独立电站,但对于高密度算力园区、绿电直供项目以及电网相对薄弱的区域,这类能力具有实际价值。

构网型储能与传统跟网型储能的差别也正在于此——后者主要跟随电网运行,前者能够主动建立电压和频率参考,为系统稳定提供支撑。

△AI生成

这种对电网角色的重新定义,首先就体现在供电链路的重构上。

首先是Watt重构,着眼于从电网到芯片的供电全链路。

面向当前阶段,华为的AIDC 1.0方案以电网友好UPS、智能锂电和构网型储能协同为基础,在保障供电连续性的同时,平滑AI负载波动,并增强对电网的支撑能力。

不同层级的设备通常承担着不同任务。UPS即不间断电源,负责保障连续供电;智能锂电进一步参与负载平滑;园区层面的构网型储能则面向电网支撑与多能源协同。

面向未来,华为提出了MIMO供电目标架构,强调多能源输入、多制式输出与多级储能协同。

上游适应风电、光伏等不同能源,下游兼容不同代际的计算设备,中间针对从微秒到小时级的变化进行分级调节。

更远期的供电路线,还包括向以固态变压器(SST)为核心的融合构网型能源路由器演进,将电能变换、储能接入与构网控制进一步集成,减少供电链路中的转换环节。

华为此次公布的泰山UPS单柜容量达到1280kVA,双变换效率最高98%;恒山直流UPS则以一套硬件平台支持270V、400V、800V等多种直流制式。

前者回应有限空间里的供电密度与效率,后者为不同计算架构的接入和后续升级保留选择。

尤其值得关注的还有多制式兼容。供电设施往往需要使用多年,在此期间,服务器会经历更新,既有机房、新建项目与不同代际的设备在电压、接口和改造条件上存在差异。

华为在战略中明确,交流和直流将在较长时间内共存,因此适配多种制式本身就是工程价值。

储能产品也沿着这一方向演进。据华为介绍,SmartLi 5.0增强了储能密度、负载平滑和安全能力,并面向800V高压直流架构演进。

△AI生成

其次是Heat重构,关注从芯片到户外的热管理,以及全生命周期的安全可靠。

华为此次介绍的AI赋能液冷系统,以TMU(热管理单元)作为控制核心,在冷量输送之外加入微小漏液检测、冷却介质健康预测和预测性维护等能力。

这一变化,对应着液冷规模部署后的实际问题。

系统要长期运行,就需要持续掌握液体、管路和设备状态,尽可能在异常影响业务之前发现风险。散热效率与运行可靠性,必须在同一套系统中考虑。

据华为介绍,TMU还与昇腾服务器实现原生适配,通过冷电联动跟随计算负载作出响应。服务器需要多大功率、热量怎样变化,珍惜信息可以更直接地进入冷却系统的控制过程。

△华为热管理控制器TMU

计算设备与热管理共享运行信息,协调各自的响应,这就是“联合设计”。而硬件系统之外,数字化运营是提升效率的另一个抓手。

接下来的Bit重构,就是把数字化、智能化贯穿到了设计、交付与运营中。

供电和热管理系统越复杂,运行信息能否被持续观察、异常能否被及时识别,就越影响运维效率。

TMU的预测性维护体现了其中一种应用;华为希望进一步将这种思路延伸到设施全生命周期,使AI能力反过来服务数据中心运行。

最后是建设方式重构。

对于AIDC,设计性能能否及时变成可用算力,取决于设备交付、现场施工与测试能否衔接。将更多集成和验证工作前移到工厂,可以减少现场串行施工与反复调试,让工厂生产与现场建设并行推进。

据华为此次公布的数据,电力模块5.0通过器件创新和产品化开发,实现占地减少40%、交付时间由7天缩短至3天。

华为在5月已亮相的全链供电Power POD,单箱容量支持3.2MW,一箱一路电,即插即用、室外部署;全链制冷IT POD则以八箱一系统实现制冷链路产品化。

△全链供电Power POD

项目交付的收益,则可以从已有案例中观察。

华为公开的商汤临港智算中心案例显示,面对18MW扩容需求,双方采用电力模块与SmartLi集装箱部署方案,通过工厂预制和室外部署,在45天内完成供配电系统交付;传统同类系统交付周期约为3个月。

将设备部署到楼顶,还释放了原本用于配电的楼内空间,为计算设备扩容提供条件。

这类案例的意义在于,供配电系统的建设可以围绕业务投产时间重新组织。

此次展示的3D数据中心,则进一步探索空间布局。借鉴芯片工厂“动力层”与“生产层”分离的理念,把供冷、IT设备、供电和备电沿垂直方向分层安排,重新协调动力设施与计算设备的位置关系。

支撑这套重构的,是华为在数字技术(Bit)、电力电子技术(Watt)、热管理技术(Heat)和储能管理技术(Battery)上的4T能力积累。

何波在峰会上强调,华为的独特优势在于同时具备能源全链路与AI全栈能力:

横向可以从绿色能源、电网、储能延伸到供电、热管理和芯片,纵向贯通基础设施、算力、模型和AI应用——从算力需求出发,开展联合设计、联合仿真和联合验证。

从供电、储能到热管理和交付,这套方案最终要回答的是同一件事,就是怎样让计算设备更快投入业务,并在不断变化的负载下持续稳定工作。

从运营者的视角,也能看到这种系统性考量。

世纪互联创始人、董事长陈升在峰会上指出,AI负载的高频跳变会给电网运行带来新的挑战,增加脱网、宽频振荡失稳等风险;他提出重构外电层、园区层和楼宇层,实现外电可互济、园区可调度、楼宇可直流化。

华为计算战略规划首席专家夏勤则从计算架构出发指出,AIDC正向算网存一体化协同架构演进,能源是基础设施的能力基座。

其实,不仅技术架构在重构,衡量AIDC效率的标尺也在发生变化。

算力工厂,用Token算能效

在供电、散热与算力之间的联系更加紧密的同时,评价AIDC的方法,也需要延伸到实际交付的业务产出。

数据中心长期使用PUE衡量能效,即总能耗与IT设备能耗的比值。它能够反映供电、制冷等辅助系统的能源开销,但不直接衡量IT设备完成了多少有效计算。

同样的PUE,可能对应不同的设备利用率、任务完成量和业务成本。通信等待、任务中断和调度不匹配,都可能让投入的电力无法转化为预期的计算结果。

所以,设施侧的节能之外,还需要观察进入服务器的能源是否得到充分利用。能源、硬件、软件和业务,需要在同一套评价目标下协同。

商汤科技大装置事业群智算中心总经理林海在此次峰会上介绍,商汤正从以PUE为核心的能效管理,进一步走向以TPW(Tokens Per Watt)为核心的全链路效率管理。

这一思路把用电效率与Token产出联系起来,将电网电厂、IDC机柜服务、算力云服务到模型服务纳入同一条评价链路。

据其披露,商汤大装置通过端到端全链路优化,已实现单位电力成本Token产出提升80%;商汤临港智算中心也是业界首个获得中国信通院算电协同5A认证的智算中心。

华为也在尝试衡量能源到计算产出的转化效率。华为董事、华为数字能源总裁侯金龙在此次峰会上将“每一瓦特产出更多Token,每一Token成本更优”,概括为算力工厂的核心竞争力。

这类评价需要与具体任务相连。不同模型、输出质量和时延要求,会影响Token产出;能耗统计的时间和边界也必须一致。

因此,PUE仍有价值,而面向业务的指标增加了另一个观察维度,即在满足质量与服务要求的前提下,一座AIDC能够持续交付多少有效计算。

评价标尺的变化,也让产业里的能力积累开始以新的方式组合。电源厂商熟悉电能转换,服务器厂商了解计算设备,数据中心运营者掌握业务需求。

而评价目标延伸到最终计算产出时,不同环节就需要更早共享信息、共同设计。

华为的优势在于同时参与了计算和能源两端的建设,计算侧有昇腾服务器、超节点和计算系统,能源侧覆盖光伏、储能、供电与热管理。

△AI生成

这种跨领域协同的能力,在TPW时代会更有价值。当评价目标延伸到最终计算产出,只有同时理解计算和能源两端,才能真正实现全链路优化。前述TMU与昇腾的原生适配,就是这种能力的一次具体落地。

更长远的问题在于,AI硬件迭代的速度,与能源基础设施的使用周期并不一致。

一座AIDC的供电、管路和建筑设施,往往要服务多代服务器。如果每换一代计算设备,配套系统就要大幅调整,扩容时间和改造成本会不断累积。

所以下一阶段的设计,需要从建成时满足需求,进一步考虑后续如何升级:核心设施要能长期复用,迭代模块可独立替换,新旧设备也需平滑共存。

前述这些设计选择,因而也有了跨代际的价值——为设施升级保留余地,让基础设施在持续服务现有业务的同时,逐步适配新的计算需求。

这种能力的门槛,在于既要理解计算系统的演进方向,也要掌握能源系统的运行规律,还要能够把设计转化为可靠的工程交付。

它需要在真实算力负载、电网条件和项目工期中持续校正,难以依靠某一个环节的单点突破快速形成。

这种跨领域能力,也为华为连接产业生态提供了支点。

AIDC建设涉及计算设备、供配电、制冷、储能与运营,能够同时理解计算与能源两端需求的厂商,更有条件衔接各方约束,推动伙伴围绕系统目标开展适配与验证。

随着项目经验积累,产品之间的协同还可以进一步沉淀为可复用的工程方法和生态协作经验。

AI基础设施继续向更大集群演进,算力与能源的联系也会更加紧密。

对AIDC厂商来说,下一阶段更难复制的竞争力,将来自对整条链路的理解,以及把这种理解转化为产品、工程与生态协作的长期能力。

华为横跨计算与数字能源的布局,正在将这些积累转化为现实的系统优势。这种跨领域能力,很难靠单点突破快速形成,也让华为在下一代AI基础设施的演进中占据了更主动的位置。

0.00%(0) 0.00%(0) 0.00%(0)
当前新闻共有0条评论
笔  名 (必选项):
密  码 (必选项):
注册新用户
标  题 (必选项):
内  容 (选填项):