Saltar al contenido principal
Zubnet AIAprenderWiki › TPU
Infraestructura

TPU

También conocido como: Tensor Processing Unit
Una familia de chips aceleradores de IA personalizados (ASIC) diseñados por Google específicamente para cargas de aprendizaje automático. Las TPU intercambian la flexibilidad de propósito general de una GPU por una arquitectura de matriz sistólica construida alrededor de grandes unidades de multiplicación de matrices, y ofrecen gran rendimiento y eficiencia energética en las matemáticas tensoriales que dominan el aprendizaje profundo. Google las utiliza internamente desde 2015, las alquila mediante Google Cloud y entrena con ellas todos los modelos Gemini.

Por qué importa

Las TPU son la prueba más sólida de que el cómputo de IA no es un mercado de un solo proveedor: son el silicio ajeno a NVIDIA que lleva más tiempo entrenando modelos de frontera a escala, y empresas como Anthropic y Apple han apostado por ellas para cargas importantes. Para los profesionales, importan como una alternativa de Google Cloud que puede superar a las GPU en relación precio-rendimiento para grandes ejecuciones de entrenamiento e inferencia de gran volumen, siempre que la pila de software encaje.

En profundidad

La TPU parte de una observación: el aprendizaje profundo es principalmente multiplicación de matrices, por lo que el chip más rápido para ello es uno que realice multiplicaciones de matrices y poco más. Mientras una GPU lleva miles de núcleos flexibles, además de cachés, planificadores y decodificadores de instrucciones, una TPU elimina la mayor parte de eso y dedica su silicio a enormes matrices de multiplicación y acumulación alimentadas directamente por memoria de gran ancho de banda. Google desplegó internamente la primera TPU en 2015 para ejecutar inferencia y desde entonces ha iterado aproximadamente cada dos años: de v2 a v4 escaló el diseño a pods de miles de chips para entrenamiento, v5p y v6 (Trillium) llevaron más lejos la escala del pod, y v7 (Ironwood, anunciada en 2025) es la primera generación construida principalmente para inferencia. El resultado es la alternativa a gran escala más antigua al hardware de NVIDIA para entrenamiento de frontera — cada generación de Gemini se ha entrenado con TPU, y durante años nada más fuera de NVIDIA entrenó modelos a ese nivel, hasta que Trainium de Amazon alcanzó una escala comparable: Anthropic informa que entrena y sirve Claude con más de un millón de chips Trainium2.

Cómo funciona una matriz sistólica

El corazón de una TPU es la Matrix Multiply Unit (MXU), una matriz sistólica — una cuadrícula de decenas de miles de elementos simples de multiplicación y acumulación conectados directamente con sus vecinos. Los pesos se cargan por adelantado en la cuadrícula; luego las activaciones entran desde un borde y fluyen a través de la matriz con un ritmo regular, mientras cada elemento multiplica, suma y pasa su resultado. Como los datos se mueven de vecino a vecino en vez de atravesar una jerarquía de caché, casi no se gasta silicio en cachés, predictores de saltos o decodificación de instrucciones, por lo que el chip dedica casi toda su área y energía a la aritmética. La contrapartida es la rigidez: la matriz solo es eficiente cuando el compilador puede dividir la carga en grandes operaciones densas de Multiplicación de Matrices — exactamente aquello de lo que constan el entrenamiento y la inferencia de transformers. Alrededor de la MXU hay una unidad vectorial para matemáticas elemento por elemento, una unidad escalar para el flujo de control y pilas de memoria de gran ancho de banda, y desde la segunda generación los chips calculan en bfloat16, un formato de precisión reducida que Google presentó con la TPU y que inició la era moderna del Entrenamiento con precisión mixta.

De v1 a Ironwood

Cada generación de TPU ha seguido la misma trayectoria: más cómputo por chip, más ancho de banda de memoria y un pod mayor. La v1 de 2015 era solo para inferencia, un acelerador de 8 bits que servía discretamente cargas de producción de Google — más tarde Google reveló que los encuentros de AlphaGo de 2016 se ejecutaron en TPU. TPU v2 (2017) añadió entrenamiento de coma flotante e introdujo el pod: 256 chips conectados mediante una interconexión personalizada para comportarse como una sola máquina, un diseño temprano para el Entrenamiento distribuido a escala. V3 (2018) redobló la apuesta con pods de 1.024 chips y refrigeración líquida, y v4 (2021) alcanzó 4.096 chips por pod con enlaces ópticos reconfigurables entre ellos. La generación v5 de 2023 se dividió en dos — v5e, optimizada para costos, y v5p, de gama alta —, seguida por v6 (Trillium) en 2024 y v7 (Ironwood) en 2025, que reúne 9.216 chips en un único pod con una potencia nominal de 42,5 exaFLOPS y es la primera TPU construida principalmente para la Inferencia en vez del entrenamiento.

La pila de software

El hardware es solo la mitad de la historia; la otra mitad es XLA, el compilador de Google, que toma un grafo de modelo y lo mapea sobre las matrices sistólicas. La pila de primera generación daba por sentado TensorFlow, que sigue siendo de primera clase, pero desde entonces el ecosistema se ha centrado en JAX, cuyo estilo funcional encaja bien con XLA, y PyTorch se admite mediante el puente PyTorch/XLA. Aquí es donde las TPU difieren genuinamente de las GPU: CUDA de NVIDIA tiene detrás una década de bibliotecas, kernels y conocimiento institucional, mientras todo en una TPU fluye por un compilador de grafo completo. Cuando el compilador maneja limpiamente el modelo — las arquitecturas Transformer estándar suelen cumplir —, la utilización es excelente, a menudo mejor que con GPU. Cuando el modelo tiene operaciones exóticas o formas dinámicas, los desarrolladores pueden pasar días convenciendo a XLA, razón por la que elegir TPU es una decisión tanto de software como de hardware y debe formar parte de cualquier plan serio de Infraestructura de IA.

No puedes comprar una

Una idea equivocada persistente es que la TPU es la respuesta de Google a la GPU en el mismo sentido — una tarjeta que puedes pedir e instalar en tus propios servidores. No lo es. Google nunca ha vendido TPU como hardware independiente (la única excepción es el pequeño coprocesador Edge TPU para dispositivos embebidos), por lo que la única forma de utilizar una TPU completa es alquilar una porción de un pod en Google Cloud. Esto da forma a toda la adopción: no existe un clúster TPU en instalaciones propias, ni mercado de segunda mano, ni manera de comparar una con una GPU en un laboratorio privado. También significa que Google controla toda la pila, desde el silicio hasta el centro de datos, lo cual explica en parte que la economía funcione. La lección más amplia que la industria extrajo de la TPU es que el silicio personalizado es viable: Groq fue fundada por el ingeniero que inició el proyecto TPU, y Amazon, Microsoft, Meta y OpenAI han lanzado desde entonces sus propios esfuerzos de chips de IA personalizados.

Quién utiliza realmente las TPU

El inquilino principal es el propio Google: Google DeepMind entrena y sirve cada generación de Gemini en pods de TPU, junto con el resto de los modelos de producción de Google, y las TPU han sustentado históricamente sistemas como AlphaGo y AlphaFold. La señal más interesante es quién más aparece. Anthropic ejecuta Claude en TPU a muy gran escala y anunció en 2025 el compromiso de utilizar hasta un millón de ellas; Apple entrenó los modelos de fundamento detrás de Apple Intelligence en clústeres v4 y v5p, y así lo indicó en sus propios informes técnicos. La propuesta es sencilla — como un ASIC omite la maquinaria de propósito general, las TPU normalmente ofrecen más cómputo por dólar y por vatio que las GPU cuando la carga encaja, una brecha que importa más a medida que el consumo energético de la IA se convierte en una restricción vinculante. La trampa es el reflejo de la sección de software: los equipos cuya pila ha invertido mucho en CUDA rara vez migran, mientras que los que ya usan JAX o están dispuestos a estandarizarse en un flujo dirigido por compilador suelen encontrar en las TPU la forma más barata de entrenar algo grande.

← Todos los términos
ESC