Saltar al contenido principal
Zubnet AIAprenderWiki › PPO
Entrenamiento

PPO

También conocido como: Proximal Policy Optimization
PPO (Proximal Policy Optimization) es un algoritmo de aprendizaje por refuerzo que actualiza una política en pasos pequeños y controlados al recortar cuánto puede alejarse cada actualización del comportamiento anterior de la política. Presentado por OpenAI en 2017, se convirtió en el optimizador predeterminado para RLHF, la etapa de entrenamiento de preferencias detrás de modelos como InstructGPT y ChatGPT.

Por qué importa

PPO es el mecanismo que permitió entrenar grandes modelos de lenguaje para seguir instrucciones y mantener su utilidad en vez de limitarse a predecir texto. Si trabajas en alineación, post-entrenamiento o modelos de razonamiento, encontrarás PPO o uno de sus descendientes — y sus costos y modos de fallo determinan lo que los equipos de entrenamiento pueden lanzar realmente.

En profundidad

PPO es un método de gradiente de política, lo que significa que mejora una política — en el trabajo con modelos de lenguaje, el propio modelo — empujándola hacia acciones que obtuvieron buenas puntuaciones y alejándola de las que obtuvieron malas puntuaciones. El truco característico es el objetivo sustituto recortado: para cada acción, PPO calcula la proporción entre la probabilidad que le asigna la política actual y la que le asignaba la anterior, multiplica esa proporción por una estimación de ventaja de cuánto mejor fue la acción de lo esperado y luego recorta la proporción a un intervalo estrecho (normalmente de 0,8 a 1,2) para que ningún batch pueda arrastrar demasiado la política. Como el recorte vuelve seguras las actualizaciones agresivas, el algoritmo puede ejecutar varias épocas de actualizaciones de gradiente por minibatches sobre los mismos datos recopilados, lo que ofrece mucha más eficiencia de muestras que los gradientes de política ingenuos. Esa combinación — estabilidad más una eficiencia de muestras decente — convirtió PPO durante años en el caballo de batalla predeterminado del Aprendizaje por refuerzo, primero en benchmarks de juegos y robótica y luego en la alineación de modelos de lenguaje.

La maquinaria alrededor del objetivo

PPO rara vez se ejecuta solo. Es un método actor-crítico, por lo que junto a la política (el actor) entrena un modelo de valor (el crítico) que predice la recompensa esperada de un estado, lo que le permite calcular ventajas mediante estimación de ventaja generalizada en vez de esperar las puntuaciones finales. En el entorno de RLHF, la factura de memoria aumenta más: una copia congelada del modelo original sirve como política de referencia y un Modelo de Recompensa separado proporciona las puntuaciones, de modo que una ejecución de entrenamiento completa puede mantener cuatro modelos en memoria a la vez. El modelo de referencia existe porque el objetivo incluye una penalización sobre la divergencia KL entre la política actual y la de referencia, lo que evita que el modelo derive hacia texto degenerado que, por casualidad, obtiene buena puntuación. Lograr que este conjunto se entrene con fluidez exige equilibrar varios hiperparámetros que interactúan — el intervalo de recorte, el coeficiente de penalización KL, la tasa de aprendizaje y la configuración de estimación de ventajas —, lo cual explica buena parte de la reputación de PPO como un método quisquilloso.

Cómo PPO impulsa RLHF

El pipeline que hizo famoso a PPO comienza con un modelo que ya ha pasado por Preentrenamiento y Ajuste fino supervisado sobre demostraciones. Después, anotadores humanos clasifican varias respuestas muestreadas para el mismo prompt, y esas clasificaciones se destilan en un modelo de recompensa que predice qué respuestas preferirá la gente. PPO toma el relevo: el modelo genera respuestas a prompts nuevos, el modelo de recompensa las puntúa y el objetivo recortado más la penalización KL actualizan los pesos para favorecer el comportamiento con mayor puntuación. Esta es, en esencia, la receta detrás de InstructGPT y ChatGPT de OpenAI, y convirtió RLHF de una idea de investigación en la forma estándar de volver útil un modelo base y hacer que siga instrucciones. La trampa es la explotación de la recompensa — lleva la optimización demasiado lejos y el modelo aprende a aprovechar peculiaridades del modelo de recompensa en vez de producir respuestas genuinamente mejores, razón por la que el ancla KL y una parada temprana cuidadosa importan tanto en la práctica.

No es sinónimo de RLHF

Una abreviación común trata PPO y RLHF como si fueran lo mismo, pero viven en niveles distintos: RLHF es el paradigma general de entrenamiento a partir de preferencias humanas, mientras PPO es apenas un optimizador que puedes conectar a él. DPO omite por completo el aprendizaje por refuerzo y ajusta la política directamente sobre pares de preferencias con una pérdida sencilla de estilo clasificación, y funciona bien para muchas tareas de alineación. GRPO, popularizado por el trabajo con modelos de razonamiento de DeepSeek, conserva el bucle de RL, pero elimina el modelo de valor y estima el baseline de cada respuesta a partir de la recompensa media de un grupo de muestras extraídas para el mismo prompt. Eliminar el crítico reduce la memoria y suprime toda una categoría de dolores de cabeza de ajuste, por lo que GRPO se ha convertido en una opción predeterminada común para entrenar modelos de razonamiento con recompensas verificables. También conviene recordar que el propio PPO es anterior a la era de los LLM — fue diseñado como algoritmo de propósito general para agentes que juegan y controlan robots simulados, y solo más tarde fue reclutado para la Alineación de modelos de lenguaje.

Las contrapartidas prácticas

Elegir PPO hoy es una decisión de criterio de ingeniería. Del lado positivo, ha sido probado en batalla a las mayores escalas, su asignación de crédito por token mediante el modelo de valor ofrece una señal de aprendizaje detallada, y años de herramientas y conocimiento práctico acumulados hacen diagnosticables sus fallos. Del lado negativo, mantener cuatro modelos en la memoria de GPU es caro, la superficie de hiperparámetros es grande e implacable, y la sobreoptimización de recompensas es un riesgo de fondo constante: las puntuaciones del modelo de recompensa pueden seguir aumentando mientras los evaluadores humanos dicen que la calidad en realidad está cayendo. Los equipos con infraestructura madura y necesidad de controlar estrechamente la dinámica de entrenamiento todavía tienden a elegir PPO, especialmente cuando las recompensas son ruidosas y no binarias. Los equipos que quieren algo más sencillo, barato y fácil de reproducir comienzan cada vez más con GRPO o DPO y solo recurren a PPO cuando esos métodos chocan contra un muro. De cualquier manera, entender PPO sigue siendo el precio de entrada — casi todos los algoritmos modernos de post-entrenamiento se entienden mejor como una modificación de él.

← Todos los términos
ESC