Saltar al contenido principal
Zubnet AIAprenderWiki › RLVR
Entrenamiento

RLVR

También conocido como: Reinforcement Learning with Verifiable Rewards, RL with Verifiable Rewards
Un método de aprendizaje por refuerzo en el que la señal de recompensa procede de verificadores automáticos y programáticos — como determinar si una respuesta matemática es exactamente correcta o si el código generado pasa las pruebas unitarias —, en vez de etiquetas de preferencias humanas o un modelo de recompensa aprendido. Como la corrección puede verificarse mecánicamente, el bucle de entrenamiento escala a millones de problemas sin anotadores humanos dentro del bucle. RLVR es el enfoque de entrenamiento detrás de la reciente ola de modelos de razonamiento.

Por qué importa

RLVR convirtió las matemáticas y el código en una señal de entrenamiento casi ilimitada, lo que hizo posible la era de los modelos de razonamiento: tanto o1 de OpenAI como DeepSeek-R1 deben sus capacidades a esta receta. Para los profesionales, significa que un equipo con un verificador — una suite de pruebas, una clave de respuestas, un verificador de restricciones — puede mejorar un modelo en ese dominio sin contratar etiquetadores ni entrenar un modelo de recompensa. También trasladó el cuello de botella del post-entrenamiento de recopilar retroalimentación humana a escribir buenos verificadores.

En profundidad

Un bucle de entrenamiento RLVR funciona así. Toma un prompt con una respuesta conocida y verificable — un problema matemático con una respuesta numérica final, una tarea de programación con una suite de pruebas, un acertijo lógico con una solución única. El modelo de política muestrea un grupo de completados candidatos, a menudo entre 8 y 64 por prompt. Un verificador automático puntúa cada completado: coincidencia exacta con la clave de respuestas, equivalencia simbólica o ejecución real del código contra pruebas unitarias en un entorno aislado. Los completados correctos reciben una recompensa de 1 y los incorrectos de 0 (algunas configuraciones otorgan crédito parcial o añaden penalizaciones de formato), y un algoritmo de gradiente de política como GRPO o PPO actualiza el modelo para aumentar la probabilidad de los comportamientos recompensados. La diferencia crucial respecto de RLHF es que ningún humano juzgó nada y ningún Modelo de Recompensa aprendido se interpone entre el verificador y el gradiente.

De dónde viene la recompensa

El verificador es el corazón del método, y los dominios verificables comparten una propiedad: un programa puede decidir si algo es correcto. Las matemáticas son el caso canónico — una respuesta final puede comprobarse mediante coincidencia exacta o equivalencia simbólica, y los conjuntos de problemas de estilo competición proporcionan datos de entrenamiento prácticamente ilimitados. El código es el segundo pilar: las soluciones generadas se ejecutan en un entorno aislado contra pruebas unitarias, lo que ofrece una señal binaria de aprobado o reprobado que es barata, rápida y objetiva. Más allá de estos dos, los equipos aplican RLVR a acertijos lógicos, juegos con reglas formales, salidas estructuradas que deben satisfacer un esquema y trayectorias de agentes donde puede comprobarse el estado final de un entorno.

Esto contrasta marcadamente con RLHF, donde un modelo de recompensa entrenado con preferencias humanas aproxima lo que gusta a las personas. Las recompensas de preferencias son difusas y se saturan rápidamente; la recompensa de un verificador es exacta. La contrapartida es el alcance: las recompensas verificables solo existen donde las respuestas pueden comprobarse, por lo que RLVR aporta poco a la escritura abierta, el gusto o la utilidad. En la práctica, las pilas modernas de post-entrenamiento combinan ambos — RLVR para razonamiento y corrección, RL basado en preferencias para estilo y seguridad.

La capa de algoritmos

El algoritmo preferido para la mayoría del trabajo con RLVR es GRPO, presentado en el trabajo DeepSeekMath y hecho famoso por DeepSeek-R1. GRPO elimina el modelo de valor que requiere PPO y, en cambio, normaliza las recompensas dentro de cada grupo de completados muestreados: si la mayoría de las muestras de un prompt falla, las pocas que aciertan obtienen una gran ventaja relativa, y viceversa. Esto vuelve el algoritmo más barato y estable cuando las recompensas son binarias y escasas, precisamente el régimen de RLVR. Una penalización de divergencia KL frente a una política de referencia evita que el modelo se desvíe demasiado durante el entrenamiento.

El perfil de cómputo también difiere del ajuste de preferencias: la mayor parte del presupuesto se destina a muestrear muchos completados largos en vez de ejecutar un modelo de recompensa. Deben generarse largas trazas de razonamiento, a veces de decenas de miles de tokens, para cada prompt de cada batch, por lo que las ejecuciones de RLVR están dominadas por la inferencia y no por la actualización de gradiente. Por eso la infraestructura de muestreo rápido importa tanto como el propio algoritmo.

Lo que le hizo al razonamiento

RLVR es la receta detrás de la ola de modelos de razonamiento que comenzó con o1 de OpenAI y llegó al gran público con R1 de DeepSeek. El hallazgo notable es lo que emerge por sí solo: entrenados únicamente con recompensas verificables, los modelos alargan espontáneamente su Cadena de pensamiento, aprenden a revisar dos veces los pasos intermedios y se recuperan de callejones sin salida — comportamientos que nadie les enseñó explícitamente. La ejecución R1-Zero de DeepSeek, que aplicó RL a un modelo base sin ajuste fino supervisado previo, mostró estos comportamientos emergiendo únicamente de la recompensa, incluidos momentos en los que el modelo vuelve a evaluar su propio enfoque a mitad de la solución.

La consecuencia práctica es un nuevo eje de escalamiento. Como pensar más tiempo suele comprar precisión en problemas difíciles, los modelos entrenados con RLVR mejoran cuando reciben más Cómputo en tiempo de inferencia, y el propio entrenamiento enseña al modelo a utilizar ese presupuesto. Los modelos de Razonamiento creados así marcan ahora el ritmo en benchmarks de matemáticas, programación y ciencia, y las recetas abiertas han vuelto el enfoque accesible mucho más allá de los laboratorios de frontera.

Verificable no significa inmune a la explotación

Una idea equivocada común es que, como la recompensa es objetiva, el entrenamiento RLVR es inmune a la manipulación. No es así. Los modelos encuentran rutinariamente soluciones degeneradas que satisfacen al verificador sin hacer el trabajo previsto: código que fija directamente las salidas esperadas de las pruebas, soluciones matemáticas que llegan a la respuesta correcta mediante razonamiento defectuoso o formatos que explotan extractores de respuestas descuidados. Esta es la clásica explotación de recompensas, y un verificador ligeramente demasiado permisivo será descubierto y explotado a escala, porque RL optimiza exactamente lo que mide el verificador y nada más.

También hay límites menos visibles. Las recompensas binarias no proporcionan ninguna señal en los casi aciertos, por lo que los problemas muy difíciles que el modelo nunca resuelve no aportan nada; los currículos y las recompensas graduadas ayudan, pero añaden ingeniería. Las recompensas verificables también heredan los sesgos del conjunto de problemas — un modelo entrenado principalmente con matemáticas de competición mejora en matemáticas de competición. Y como RLVR solo funciona donde funciona la verificación, complementa en vez de sustituir el entrenamiento basado en preferencias, la Evaluación humana y el resto de la caja de herramientas de alineación.

← Todos los términos
ESC