
过去几年,人们谈论人工智能(AI)时,更关注AI大模型有多“聪明”、AI芯片的算力有多强、一个“顶流”AI产品能走多远……如今,一些更基础、更现实的追问开始浮出水面:支撑AI运转的电力从哪里来?这套庞大的智能系统该如何稳定、低碳、高效地运行?
2024年,微软公司与美国能源企业星座能源公司签署长期购电协议,计划推动宾夕法尼亚州三哩岛核电站1号机组重新投入运行,为包括数据中心在内的用电需求提供稳定电力。几乎在同一时期,谷歌公司宣布与核能企业凯洛斯能源合作,探索在2030年前后部署小型模块化反应堆,为数据中心和相关业务提供全天候无碳电力。从表面看,这些新闻都涉及能源行业,核电、购电、反应堆这些概念似乎离普通人的生活很远。但若将其放在一起看,就会发现它们共同指向同一个现实:AI并不是悬浮在云端的、无形的技术,它必须“落”在服务器、芯片、机房、冷却系统和电网之上。

美国宾夕法尼亚州三哩岛核电站
AI为何越来越“吃电”
如今,人们向AI提问已经像搜索和发消息一样自然:一次输入,几秒等待,答案便出现在屏幕上。对用户来说,在这个过程中完全感觉不到AI背后的资源消耗。然而,每一次AI交互都对应着服务器集群的高速运转、芯片的持续计算、网络设备的数据传输。
同样是“输入一句话,得到一个结果”,传统搜索引擎做的是“检索”。它像是在一座庞大的图书馆中迅速找到已有内容,再把链接、摘要等返回给用户。而AI做的是“生成”,它需要调动庞大的神经网络,根据上下文一步步计算、预测,再把答案逐句写出来。两者都离不开数据中心,但工作方式不同,算力消耗也不在一个量级上。
我们不妨将一项输入AI系统的任务拆开来看。此次任务是“让AI对一篇长文进行总结”。首先,AI系统要把用户输入的内容切分成一串串可供模型识别的“词元”。随后,请求被发送到数据中心,由调度系统分配给合适的计算节点。接下来,AI大模型通过高性能图形处理器(GPU)进行逐步推理,反复读取模型参数和上下文信息,预测下一个最可能出现的词元,直到生成完整答案。这一过程中,参与任务执行的不仅有计算芯片,还包括高速内存、存储系统、网络设备、供电系统、冷却装置等。一次几秒钟的对话,背后对应的是一整套高负荷协同运转的计算与能源系统。如果用户要求AI生成图片、视频,背后的计算链条还会更长。
不过,真正的“耗电大户”并非来自用户的一次次“任务请求”,而是AI大模型诞生之前的训练阶段。训练AI大模型需要大量GPU连续运行数周甚至数月,对海量数据进行反复迭代。处于领先梯队的AI大模型,每一次能力提升都需要规模更大的数据、更复杂的网络结构和更长的训练时间。虽然不同机构对单个模型训练能耗的估算差异较大,但基本趋势已经明确,训练AI大模型需要消耗大量电力,而且这种消耗并不是一次性的。如今,随着AI模型开发公司之间的竞争愈发激烈,模型版本升级的间隔越来越短,模型训练几乎一刻不停。因此,原本集中于某个时段的高能耗训练成本,正在变成长期持续的基础成本。

数据中心服务器机房基础设施示意图
除了AI大模型运行和训练带来的“直接耗电”,还有一项经常被忽视的能源开支—散热。当成千上万枚芯片同时在机架中运行,热量会迅速聚集。如果一个数据中心的冷却能力跟不上,芯片便只能降频运行,计算性能随之下降;情况严重时,还可能影响设备的稳定性和使用寿命。为了维持适宜的运行环境,数据中心需要持续运行冷却系统,而该系统本身会消耗额外电力,有些冷却方式还会增加用水需求。
因此,数据中心常常使用电能利用效率(PUE)来衡量能效。PUE是数据中心总耗电量与服务器、芯片、存储和网络设备等计算设施耗电量的比值。理论上,PUE越接近1,说明用于制冷、供配电损耗等辅助环节的电力越少,这样便可以将更多电力用于计算和数据处理。面向AI时代,数据中心的竞争不仅在于服务器和芯片规模,也在于能否用更低的辅助能耗支撑高强度的计算。

数据中心机房布局中的网络电缆
算力尽头是电力
过去,人们常用一种相对线性的方式理解计算能力的提升:芯片性能不断提高,服务器数量持续增加,计算系统的整体能力也随之增强。然而,进入AI时代后,计算能力的提升开始受到越来越多现实条件的制约。
近年来,虽然芯片制程持续演进,但继续依靠缩小晶体管尺寸来换取性能大幅提升,已经越来越难。与此同时,承载AI训练和推理任务的高性能计算卡(用于增强计算能力,可以搭载GPU或其他类型的AI专用芯片)的功耗也在不断上升。一些高性能计算卡的单张功耗已达到数百瓦甚至更高,当成千上万张计算卡被部署在同一数据中心内,问题就不再只是“算得够不够快”,而是“供电、散热和整个系统能不能承受如此高负荷的计算需求”。
在AI时代,数据中心内部的能耗结构正在发生深刻变化。许多人误以为数据中心消耗的电能主要用于计算,事实并非如此。一个现代AI数据中心除了要保证机房中大型服务器的用电,还要为制冷、供电冗余、安全系统、消防系统等配套设施付出能耗。算力需求每一次升级,背后的供电和散热系统往往都要随之扩容。
更严苛的约束来自电网本身。数据中心的用电负荷一旦在局部地区快速集聚,压力就会从企业机房传导到更宏观的电力系统层面,进而考验当地输电线路承载能力、变电设施扩容速度、电网接入审批效率以及电价形成机制。国际能源署预测,到2030年,全球数据中心年用电量可能达到945太瓦时,略高于日本目前全年的用电量,其中AI是推动增长的重要因素之一。也就是说,AI带来的并不是零散的新增用电,而是足以改变局部电力格局的持续负荷。
美国弗吉尼亚州北部就是一个典型样本。这里是“全球最重要的数据中心走廊”之一,该州相关报告显示,北弗吉尼亚的数据中心运行容量约占全球已报告总量的13%,在美洲市场中的占比约为25%。当大量云计算、互联网和AI科技公司把机房集中建在同一地区,电力压力便不再只停留在企业园区内部,而是传导到公共基础设施层面。2024年7月,当地一次电压波动曾触发约60座数据中心同时脱网,约1500兆瓦的数据中心用电负荷在短时间内消失,迫使电网运营方紧急调整供需平衡。这说明,AI数据中心的快速集聚,不只是“多用一些电”,还可能改变局部电网的运行方式。对AI科技企业来说,找到合适的芯片只是第一步,获得稳定、低碳、成本可控的电力供应,正在成为同样关键的前置条件。
中国的算力布局也在试图缓解类似的结构性矛盾。我国东部地区拥有更集中的用户、产业和网络需求,适合发展低时延业务和边缘计算;西部和北方一些地区则拥有较丰富的风能、太阳能资源,以及较适宜自然冷却的气候条件,更适合承接大规模训练、离线分析等无需即时反馈的任务。
呼和浩特的绿色算力实践可以作为这一趋势的注脚。依托内蒙古较丰富的新能源资源,当地正在推动绿电直供、算电协同、液冷服务器测试和智算中心建设。中国移动智算中心(呼和浩特)等项目也尝试从绿电使用、制冷方式和能耗管理等方面降低算力设施的环境压力。对AI产业而言,这类布局说明,算力基础设施的竞争正在从“谁有更多服务器”转向“谁能以更加稳定、低碳、高效的方式组织算力”。
此外,AI数据中心承载的任务类型和用电特征也与传统数据中心有较大差异。
过去,许多互联网业务的流量有波峰波谷,可以通过调度和错峰缓解压力;但大模型训练常常要求大量GPU长时间连续运行,功耗持续维持在高位,留给系统“喘口气”的空间很小。推理业务虽然单次请求时间较短,但一旦用户规模扩大,请求数量持续上升,也会形成稳定而庞大的电力负荷。这样的运行方式,对供电可靠性、制冷系统和应急能力都提出了更高要求。
由此可见,算力问题的性质已经发生变化。它不再只是“有没有足够服务器”的问题,而是延伸为对电力供应、冷却能力、电网接入和系统协同能力的综合考验。随着AI发展深入现实世界,能源不再只是背景条件,而成为决定技术路线和产业布局的重要因素。
探索降低能耗之路
面对不断上升的能耗压力,全球科技产业界正在从芯片设计、模型算法、能源供给、冷却方式和城市基础设施等多个方向寻找出路。

广东江门太阳能鱼塘
硬件、算法与模型
在硬件层面,能效正在成为衡量AI芯片设计和服务器系统的重要指标。过去,人们衡量AI芯片时,首先关注的是算力峰值;如今,单位能耗下的有效计算,正在变得同样关键。更高的内存带宽、更先进的芯片封装、更高效的互联架构,本质上都是为了减少不必要的数据搬运和能量损耗。对于AI系统而言,很多能耗并不直接来自计算本身,而是来自数据在芯片、内存和服务器之间的移动。只有将每一次计算背后的数据流动成本降下来,AI系统才可能在提升性能的同时降低能耗。
在算法层面,AI大模型也在从“大而全”走向“更精细地调用”。早期的AI大模型在处理任务时多采取“全体上阵”策略,无论问题繁简,都调动大量参数参与计算。这样虽然有利于追求性能上限,却也造成了不少无效消耗。近年来逐渐成熟的混合专家模型则提供了另一种思路:不是每次都让整个AI大模型全面启动,而是根据任务需求调用其中更合适的部分去工作。这样一来,不必要的计算减少了,单位任务的能耗也有望下降。
AI小模型和AI端侧模型的进步同样值得注意。过去许多必须放在云端完成的任务,如今已经可以在手机、电脑、车载智能系统等终端上进行“本地”处理。例如,语音转写、图片修复、简单文本生成、个人助理类操作等任务正在越来越多地被迁移至终端侧完成。对用户而言,这意味着响应更快、隐私更可控;对系统而言,则意味着部分请求被分流,不再全部压向大型数据中心。这样做不会消除能耗,但会改变能耗分布,让原本高度集中的压力有所缓解。
能源供给与协同
在能源供给层面,数据中心正在更主动地寻找稳定、低碳、可预测的电力来源。虽然风能和太阳能是可再生清洁能源,但实际发电量容易受到天气和昼夜变化的影响,而数据中心需要的是全天候、稳定可控的电力供应。因此,科技企业一方面继续采购更多可再生能源,另一方面也开始构建更稳定的能源组合:以核能为代表的能够持续输出的电源承担基础供电,以储能系统缓冲风电、光伏的供电波动,并通过电网调度提高供需匹配效率。也就是说,AI时代的数据中心不再只是电力系统的终端用户,而是越来越深地嵌入能源供给、调度和基础设施建设之中。
从全球范围看,数据中心与能源系统的关系正在变得更加紧密。在中国,这种变化则具体体现为算力与电力的协同布局。2024年,我国有关部门联合印发《数据中心绿色低碳发展专项行动计划》,提出要强化“东数西算”规划布局刚性约束,支持非实时算力设施向西部枢纽节点迁移,并统筹大型风电、光伏基地与国家枢纽节点建设。也就是说,算力设施的建设不能只由需求密度决定,还需要综合考虑网络时延、能源结构、水资源、气候条件和产业需求,在条件适宜的区域进行布局。
革新冷却方式
冷却方式的变化也是一条重要革新路线。随着高端芯片的功率密度不断提高,传统风冷方式已接近极限,液冷则越来越受到重视。与空气相比,液体传热效率更高,可以迅速带走芯片产生的热量。在液冷系统中,冷却液通过冷板、管路或浸没方式接触发热部件,把热量传出机柜,再通过换热系统排出或回收利用。这样不仅有助于降低制冷能耗,还能提高设备运行的稳定性。
阿里云计算公司在2015年前后开始探索浸没式液冷技术。所谓浸没式液冷,是把服务器中的关键部件浸入绝缘冷却液中,通过液体直接带走热量。这种方式听起来有些“反常识”—电子设备不是最怕进水吗?但冷却液并不是普通的水,而是不导电、具有较好传热能力的特殊液体。公开案例显示,阿里云相关浸没式液冷数据中心曾实现了较低的PUE,并提升了单机柜功率密度。对高强度的AI计算而言,这类技术的价值不仅在于省电,还在于让原本难以承载高功率的服务器集群具备工程可行性。

阿里云计算公司总部夜景
除了液冷,一些地区还在探索余热回收。传统数据中心会把服务器产生的热量排向外部环境,而热回收思路则是把这部分热量重新接入城市能源系统。以瑞典斯德哥尔摩为例,当地的区域供暖管网允许数据中心将运行过程中产生的余热输送给城市供暖系统。服务器运行产生热量后,先由冷却液体带走热量,再通过热交换装置将其转移到供暖系统中,最终进入城市供暖管网。
中国北方一些地区也具备类似条件。由于冬季供暖需求较高,数据中心产生的余热如果能够被有效回收,就可能从“必须排掉的废热”转化为“可以利用的热源”。例如,内蒙古乌兰察布的智算中心已开始探索将机房余热用于冬季供暖。
AI亦能反哺能源
AI带来的能耗压力不容忽视,但它与能源系统的关系并不只是单向消耗。事实上,越来越多先进的AI系统也正被用于提升能源生产、输送和使用的效率。
早在2016年,谷歌旗下的DeepMind公司就曾将机器学习技术用于数据中心冷却系统优化。机器学习是人工智能科学的重要分支,它可以从大量运行数据中寻找规律,并给出高效合理的解决方案。通过分析温度、湿度、气流、设备负荷、电力使用效率等数据,机器学习技术帮助谷歌数据中心将冷却能耗降低了约40%。可见,数据中心虽然是能耗大户,但其运行过程高度数据化,各类指标都可以被持续采集和建模。AI如果能够在复杂变量之间找到更合理的控制策略,就有机会在不影响稳定运行的前提下降低能耗。在风电和光伏领域,AI同样有用武之地。风能和太阳能面临的一大难题,是发电量容易随天气变化而波动。AI大模型能够预测风速、云量、日照情况,让调度系统更精准地安排发电、储能和用电负荷。对电网来说,预测精度越高,就越容易将不稳定的可再生能源纳入供电体系,减少弃风、弃光和备用电源浪费。
在中国,新能源装机规模不断扩大,如何消纳风能、太阳能并保证电网稳定已经成为能源体系绿色转型中的关键问题。绿色算力基地如果能够与绿电直供、储能、智能调度结合起来,就可能形成新的产业模式:白天太阳能发电量较高时,安排部分可延时计算任务;夜间风力资源丰富且用电低谷时,排布耗时久、耗能高的训练任务或离线分析任务;在电网负荷紧张时,则通过算力调度降低局部压力。这样的“算电协同”,本质上是把计算任务也纳入能源系统调度之中。
在材料科学领域,AI也大有用武之地。传统材料研发往往需要研究者在大量候选材料中反复筛选和验证,周期长、成本高。AI可以先在计算层面缩小搜索范围,帮助科学家更快锁定具有高潜力的候选材料。对于电池、储能和清洁能源技术来说,这种能力有助于提高研发效率,加快新材料从实验室走向实际应用。
在核聚变研究领域,AI也开始参与高难度的科研任务。核聚变装置需要在极端条件下维持等离子体稳定,而等离子体本身高度复杂,状态变化快,控制难度大。一旦控制不当,核聚变装置就可能偏离理想状态,影响实验效果。机器学习技术可以帮助研究者处理复杂的传感数据,识别等离子体运行中的细微变化,并优化控制策略。对于仍在探索中的聚变能源而言,AI不是替代科学家的“捷径”,而是帮助研究者理解复杂系统、改进实验控制的新工具。
当然,AI对能源系统的帮助,并不会自动抵消它自身带来的能耗增长。AI能否变得更绿色、更可持续,取决于两个方向能否同步推进:一方面,AI系统自身要不断提高能效,减少无效计算和基础设施浪费;另一方面,也要让AI多参与能源生产、输送、储存和消费过程,帮助电网、工厂、建筑和城市基础设施降低整体能耗。
AI能耗的变化不会只发生在实验室或大型数据中心里,也会逐渐进入更广阔的现实场景中。未来,手机和电脑上的部分AI任务可以在本地完成,减少对云端数据中心的依赖;城市供暖、交通和电网调度可以变得更加精细,减少不必要的能源浪费;风电场、光伏电站、储能系统和数据中心,也可能在后台算法的协调下实现更高效的协同运行。
从这个意义上说,“绿色智能”不是给AI贴上一个环保标签,而是对AI发展方式的一次重新审视。算力可以继续增长,模型可以不断进化,但支撑它们运行的电力、冷却系统和其他基础设施并非取之不尽。未来真正成熟的AI,不仅要回答人类提出的问题,也要回答自身如何持续运行的问题。只有当AI在变得更强大的同时,也变得更高效、更节制,它才可能摆脱沉重的电力账本,走向可持续发展的未来。
【责任编辑】张小萌
