TPU
为什么重要
深度解析
TPU 从一个观察出发:深度学习主要就是矩阵乘法,那么最快的芯片,就该只做矩阵乘法,其他事情越少越好。GPU 带着数千个灵活核心,以及缓存、调度器和指令解码器;TPU 却剥掉大部分结构,把硅片专门留给巨型乘加阵列,再由高带宽内存直接供数。Google 于 2015 年在内部部署第一代 TPU 运行推理,此后大约每两年迭代一次:v2 到 v4 把设计扩展成由数千颗芯片组成的训练 pod,v5p 和 v6(Trillium)继续扩大 pod,v7(Ironwood,于 2025 年公布)则是第一代主要为推理打造的版本。结果就是,它是前沿训练中历时最久的大规模替代 NVIDIA 硬件的方案——每一代 Gemini 都在 TPU 上训练;多年来 NVIDIA 之外没有别的芯片在这个层级训练过模型,直到亚马逊的 Trainium 达到相当规模:Anthropic 表示已使用超过一百万颗 Trainium2 芯片来训练和服务 Claude。
脉动阵列如何运作
TPU 的心脏是矩阵乘法单元(MXU),一套脉动阵列——由数万个简单乘加元件组成的网格,每个元件都直接连到邻居。权重预先装入网格,激活值再从一侧流入,以规则节奏横穿阵列;每个元件一边相乘、累加,一边把结果传下去。数据逐邻居移动,不经过缓存层级,因此几乎没有硅片面积浪费在缓存、分支预测器或指令解码上,芯片把几乎全部空间和能量都用来做算术。代价是僵硬:只有当编译器能把工作负载切成大块、稠密的Matrix Multiplication时,阵列才高效——Transformer 训练与推理恰好就是由这些运算构成。MXU 周围还有负责逐元素数学的向量单元、负责控制流的标量单元,以及一摞高带宽内存;从第二代开始,芯片便使用 bfloat16 计算,这是 Google 随 TPU 一起推出的低精度格式,也由此开启现代混合精度训练时代。
从 v1 到 Ironwood
每一代 TPU 都沿着同一条轨迹前进:单颗芯片算力更高、内存带宽更大、pod 规模也更大。2015 年的 v1 只支持推理,是一款默默服务 Google 生产工作负载的 8 bit 加速器——Google 后来透露,AlphaGo 2016 年的比赛就是在 TPU 上运行。TPU v2(2017)加入浮点训练,并引入 pod:256 颗芯片通过定制互连绑在一起,行为如同一台机器,是大规模分布式训练的早期蓝图。v3(2018)继续加码,pod 达到 1024 颗芯片并采用液冷;v4(2021)则达到每 pod 4096 颗芯片,芯片间使用可重构光学链路。2023 年的 v5 一分为二——成本优化的 v5e 与高端 v5p——之后是 2024 年的 v6(Trillium)和 2025 年的 v7(Ironwood);v7 在单个 pod 中塞进 9216 颗芯片,额定算力 42.5 exaFLOPS,也是第一款主要面向推理而不是训练的 TPU。
软件栈
硬件只讲了一半故事,另一半是 Google 编译器 XLA,它把模型图映射到脉动阵列。第一代软件栈默认使用 TensorFlow,而 TensorFlow 至今仍是一等公民;不过生态此后转向以 JAX 为中心,它的函数式风格与 XLA 很合拍,PyTorch 则通过 PyTorch/XLA 桥接支持。TPU 与 GPU 真正的区别就在这里:NVIDIA CUDA 背后有十几年的库、kernel 和机构经验,TPU 上的一切却都要流经整图编译器。编译器若能干净处理模型——标准 Transformer 架构通常符合条件——利用率会非常优秀,常常胜过 GPU。模型若带奇特算子或动态 shape,开发者却可能花几天哄 XLA;所以选择 TPU 与其说是硬件决策,不如说同样也是软件决策,任何认真的AI 基础设施计划都必须把它算进去。
你买不到一颗
一个挥之不去的误解是,TPU 与 GPU 意义相同,是 Google 推出的对手——一张可以买回来插进自有服务器的卡。并不是。Google 从未把 TPU 作为独立硬件销售,唯一例外是面向嵌入式设备的小型 Edge TPU 协处理器;使用完整 TPU 的唯一方式,就是在 Google Cloud 上租用 pod 的一部分。这塑造了采用方式的一切:没有本地 TPU 集群,没有二手市场,也无法在私有实验室中拿一颗与 GPU 做基准对比。这还意味着 Google 从硅片到数据中心掌控整个软件栈,也是经济账能够成立的部分原因。行业从 TPU 身上得到的更大教训是,定制芯片确实可行:Groq 由启动 TPU 项目的工程师创立,Amazon、Microsoft、Meta 和 OpenAI 此后也都发起了自己的定制 AI 芯片计划。
究竟谁在使用 TPU
锚定租户是 Google 自己:Google DeepMind 在 TPU pod 上训练并提供每一代 Gemini,Google 其余生产模型也是如此;AlphaGo、AlphaFold 等系统在历史上同样由 TPU 支撑。更有意思的信号来自其他使用者。Anthropic 以极大规模在 TPU 上运行 Claude,并于 2025 年宣布承诺最多使用 100 万颗;Apple 则在 v4 和 v5p 集群上训练 Apple Intelligence 背后的基础模型,并在自己的技术报告中明确说明。卖点很直接——ASIC 跳过通用机器,所以当工作负载适配时,TPU 通常比 GPU 每美元、每瓦都提供更多计算;随着 AI 能源消耗变成硬约束,这道差距只会更重要。问题恰好是软件章节的镜像:软件栈已经深深押在 CUDA 上的团队很少迁移,已经使用 JAX 或愿意统一采用编译器驱动工作流的团队,则常会发现 TPU 是训练大型模型最便宜的方式。