AI Energy Consumption
为什么重要
深度解析
首先要理解训练与推理的分野。训练前沿模型是一阵单次的巨大爆发:数万颗加速器同步运行数周或数月,最大训练任务的能耗估计落在几十 GWh——大致相当于一座小镇一年的用电量。推理的形态正好相反:每次请求都很便宜,但每天数十亿次请求会累积;随着部署使用量暴涨,推理已经超过训练,成为 AI 总耗电需求中更大的一部分。两个阶段最终都会落在同一个地方——数据中心——在那里,GPU 和 TPU 把电力转成热量,随后还得把热移走;所以现代 AI 园区围绕变电站和冷却所做的工程,绝不亚于围绕硅片的工程。
训练与推理
一次前沿训练会把能耗集中在一个时间窗口里。背后的集群——数万颗通过高带宽网络连接的加速器——在运行期间可能持续拉取 100 MW 甚至更多 IT 负载,因此训练场地会围绕现成变电站和便宜、稳定的电力选择。小型任务也很重要:对现有模型做微调,比从零训练便宜几个数量级,但数千个组织每天都这样做,加起来依然可观。
推理则把能耗摊开。每生成一个 Token 都只耗费一点点计算,但热门模型昼夜服务数百万用户,电表从不停转。Google 2025 年自己的测量显示,一条 Gemini 文本提示词的中位能耗约为 0.24 Wh;独立机构对同类聊天机器人的估计也落在零点几 Wh 的范围——单次请求很小,聚合起来却很大。推理模型还大幅推高了单次请求能耗,因为它们在给出可见答案前,会先生成漫长的隐藏思维链。经验法则是:训练能耗随缩放定律描述的模型与数据集规模增长,推理能耗则随用户数、上下文长度和输出长度增长。
GW 级园区与核电协议
行业的回应是一场以 GW 计量的建设潮,也是现代AI 基础设施的核心部分。已经公布的 AI 园区单址规划容量达到 1 GW 或更多——相当于一座大型核反应堆的输出——IEA 估计,2024 年全球数据中心耗电约 415 TWh,占全部电力约 1.5%;到 2030 年,这个数字将增长一倍以上,AI 是主要驱动因素。压力已经在局部显现:2023 年,美国数据中心消耗全国约 4.4% 的电力,联邦预测 2028 年将达 7–12%;在爱尔兰,数据中心约占全国需求五分之一,促使都柏林周边限制新增连接。
电网无法以同样速度扩张,于是最大的买家直接走向电源。Microsoft 签下 20 年协议,重启 Three Mile Island 未受损的反应堆,锁定约 835 MW 全天候无碳电力;Google 与 Kairos Power 达成协议,计划到 2035 年部署总计约 500 MW 的小型模块化反应堆;Amazon 随后也签了自己的核电园区交易。这些协议与其说是绿色品牌宣传,不如说是物理现实:训练与服务集群需要稳定的全天候电力,而只有核能和少数其他能源能以 GW 规模提供。
一次查询不会压垮电网
一种常见说法是,每一次聊天机器人查询都是环境灾难,但单次查询数字并不支持它。零点几 Wh 的文本提示词,大致相当于 LED 灯泡点亮几分钟,远低于早期病毒式传播的估计;那些估计错误地假设每次查询都会触发一次全新的巨大计算。随着模型和服务栈进步,单次查询数字也还在下降。
但相反的说法——AI 能耗不值一提——同样错误。影响存在于总量:每天数十亿次请求;图像、视频生成等远比文本昂贵的重模态;以及 AI 不断嵌进搜索、办公软件和客服后复合增长的需求。末日标题与轻描淡写都错过了真实画面:这是电网层面的规划问题,不是单次查询的内疚问题。
效率提升与杰文斯反弹
效率曲线确实非常陡。量化、蒸馏、推测解码和混合专家架构,都能大幅削减每 token 计算量;从 NVIDIA 到竞争对手,每一代加速器也都显著提升每瓦性能。Model Serving软件栈也变得更聪明,靠 KV 缓存复用与连续批处理维持高利用率;一部分推理还在移向边缘设备,由小模型在本地运行。
然而总耗电量仍在增长,这正是杰文斯悖论发挥作用:每 token 成本下降时,需求不会保持不变——过去不划算的应用会启动,使用量则扩张到填满预算。Token 价格大约每年下降一个数量级,总推理量却增长得更快。现实展望不是效率拯救电网,而是效率决定一张给定电网究竟能交付多少 AI。