AI Energy Consumption
為什麼重要
深度解析
首先要了解訓練與推論的差異。訓練前沿模型是一次性的巨大用電高峰:數萬顆加速器同步執行數週或數月,最大型訓練工作的能源消耗估計達數十 GWh——約相當於一座小鎮的全年用電量。推論的型態正好相反:每項請求成本很低,但每天數十億項請求會不斷累積;隨部署後的使用量暴增,推論已超越訓練,成為 AI 總電力需求中較大的部分。兩個階段最終都位於同一處——資料中心——其中 GPU 與 TPU 將電力轉為熱能,之後還必須排出熱量;因此,現代 AI 園區的工程設計同樣重視變電站與冷卻設施,而不只著眼於矽晶片。
訓練與推論
一次前沿訓練會將能源消耗集中在單一時段。背後的叢集——由高頻寬網路連接的數萬顆加速器——在訓練期間可能持續耗用 100 MW 以上的 IT 負載,因此訓練場址會依現有變電站,以及價格低廉且供應穩定的電力選擇。較小型的工作也很重要:對現有模型進行微調,成本比從頭訓練低數個數量級,但數千個組織每天進行微調,累積用量依然可觀。
推論則將能源消耗分散至較長時間。每生成一個 Token 只需要極少運算,但熱門模型全天候為數百萬名使用者提供服務,因此電力消耗從不中斷。Google 在 2025 年自行測量的結果顯示,一則 Gemini 文字提示詞的能源消耗中位數約為 0.24 Wh,而獨立機構對類似聊天機器人的估計也落在零點幾 Wh 的範圍——單次請求很少,總量卻極為龐大。推理模型還大幅提高每項請求的能源用量,因為它們會在產生可見答案前,先生成很長的隱藏思維鏈。經驗法則是:訓練用電量會按照Scaling Laws(縮放定律)隨模型與資料集規模增加,而推論用電量則隨使用者人數、上下文長度及輸出長度增加。
GW 級園區與核能協議
業界的回應,是一波以 GW 計算的建設熱潮,也是現代AI 基礎設施的核心部分。已公布的 AI 園區單一場址規劃容量達 1 GW 以上——相當於一座大型核子反應爐的輸出——而 IEA 估計,全球資料中心在 2024 年耗用約 415 TWh,占全球用電量約 1.5%;這個數字到 2030 年將成長一倍以上,主要驅動因素就是 AI。壓力已在各地顯現:美國資料中心於 2023 年耗用全國約 4.4% 的電力,聯邦政府預測到 2028 年將達 7–12%;在愛爾蘭,資料中心約占全國需求五分之一,促使都柏林周邊限制新增電網連線。
由於電網無法以同樣速度擴張,最大的買家直接轉向電力來源。Microsoft 簽訂 20 年協議,重啟 Three Mile Island 未受損的反應爐,取得約 835 MW 的全天候無碳電力;Google 與 Kairos Power 達成協議,計畫在 2035 年前部署總計約 500 MW 的小型模組化反應爐;Amazon 隨後也簽署自家的核能園區協議。這些協議與其說是綠色品牌宣傳,不如說源自物理限制:訓練與服務叢集需要可靠的全天候電力,而只有核能與少數其他來源能以 GW 規模供應。
一次查詢不會壓垮電網
常見的說法是,每項聊天機器人查詢都是環境災難,但單次查詢資料並無法證實這種說法。耗用零點幾 Wh 的文字提示詞,大約相當於 LED 燈泡亮起數分鐘,遠低於早期廣為流傳的估計;那些估計假設每次查詢都會觸發龐大的全新運算。隨模型和服務堆疊改善,單次查詢用量也持續下降。
但相反的主張——AI 能源用量不是問題——同樣錯誤。影響來自總量:每天數十億項請求、成本遠高於文字的圖像與影片生成等較重模態,以及 AI 內建於搜尋、辦公室軟體和客戶服務後不斷累積的需求。無論末日式標題或輕忽問題,都未能反映真實情況:這是電網層級的規劃問題,而非單次查詢的罪惡感問題。
效率提升與傑文斯反彈
效率改善的幅度確實很大。量化、Distillation(蒸餾)、Speculative Decoding(推測性解碼)及專家混合架構,都能大幅降低每個 token 的運算量,而 NVIDIA 及其競爭對手推出的每一代加速器,也都顯著提高每瓦效能。Model Serving堆疊也更加智慧,透過重複使用 KV 快取與連續批次處理維持高使用率;部分推論則移轉至邊緣裝置,由小型模型在本機執行。
然而,總用電量仍持續成長,這正是傑文斯悖論的作用:當每個 token 的成本降低,需求並不會維持不變——過去不具經濟效益的應用程式開始啟用,使用量也會擴大至填滿預算。Token 價格約每年降低一個數量級,而總推論量成長得更快。務實的展望並非效率會拯救電網,而是效率會決定一座既有電網能提供多少 AI。