Post-entrenamiento
Por qué importa
En profundidad
Un modelo base recién salido del preentrenamiento es un artefacto potente pero incómodo: continúa texto en vez de responder preguntas, no tiene concepto alguno de ser un asistente e imitará lo peor de sus datos de entrenamiento con la misma facilidad que lo mejor. El post-entrenamiento convierte ese artefacto en un producto mediante una secuencia de etapas, cada una con sus propios datos, objetivo y modos de fallo. La receta clásica — popularizada por InstructGPT de OpenAI en 2022 y utilizada hoy de alguna forma por todos los grandes laboratorios — comienza con ajuste fino supervisado sobre demostraciones, pasa a la optimización de preferencias y añade cada vez más una fuerte dosis de aprendizaje por refuerzo. Todo el pipeline cuesta una pequeña fracción del cómputo de Preentrenamiento, pero determina casi todo lo que realmente experimenta un usuario: estilo, formato, negativas y la forma de razonar del modelo.
El ajuste fino supervisado viene primero
La primera etapa es el Instruction Tuning: ajuste fino supervisado sobre pares de entrada y salida que muestran al modelo cómo se ve una buena respuesta de asistente. Los datasets son minúsculos según los estándares del preentrenamiento — entre miles y millones de ejemplos curados en vez de billones de tokens —, y la calidad domina a la cantidad porque el modelo absorbe todos los hábitos presentes en las demostraciones. Gran parte de estos datos ahora son Datos sintéticos, generados y filtrados por modelos más potentes en vez de anotadores remunerados. SFT también instala la plantilla de chat, los tokens especiales que marcan los turnos del sistema, el usuario y el asistente, por lo que las versiones base e instruct del mismo modelo se comportan de maneras tan distintas. Si exageras esta etapa, el modelo comienza a perder capacidades del preentrenamiento, una forma leve de olvido catastrófico que aparece como regresiones en habilidades que nadie tocó.
Ajuste de preferencias con RLHF y DPO
Las demostraciones no pueden enseñarlo todo, por lo que la siguiente etapa optimiza preferencias: evaluadores humanos clasifican pares de respuestas del modelo, las clasificaciones entrenan un Modelo de Recompensa y la política se ajusta para obtener una buena puntuación frente a él. La receta original ejecuta aprendizaje por refuerzo, normalmente PPO con una penalización KL que evita que la política se desvíe demasiado, y este pipeline de RLHF es lo que convirtió modelos base de clase GPT-3 en ChatGPT. DPO (2023) condensó todo el bucle en un objetivo de estilo supervisado aplicado directamente a pares de preferencias, sin necesidad de modelo de recompensa ni maquinaria de RL, lo que puso el ajuste de preferencias al alcance de cualquiera que pueda ejecutar un ajuste fino. Ninguno de los métodos sale gratis: los modelos de recompensa se optimizan en exceso a medida que la política aprende a explotar sus puntos ciegos, y el ajuste de preferencias es un impulsor conocido de la adulación, ya que los evaluadores tienden a recompensar respuestas agradables, seguras de sí mismas y halagadoras.
La era del razonamiento cambió las cuentas
El mayor cambio reciente es el aprendizaje por refuerzo con recompensas verificables: en lugar del juicio humano, la recompensa procede de un verificador automático — ¿coincide la respuesta matemática con la clave?, ¿pasa el código las pruebas unitarias? Como no necesita etiquetadores, este estilo de entrenamiento RLVR escala mucho más allá de los datos de preferencias, y algoritmos como GRPO, presentado por DeepSeek en 2024, reducen aún más el costo al eliminar por completo el modelo de valor. Esta es la receta detrás de la generación de modelos de razonamiento — o1 de OpenAI, DeepSeek-R1 y sus sucesores —, donde los modelos aprenden mediante RL largas cadenas de pensamiento, retroceso y autocorrección en vez de imitación. Un atajo popular es la Destilación: entrenar un modelo más pequeño con las largas trazas de razonamiento de un modelo de frontera y capturar buena parte del comportamiento sin ejecutar RL en absoluto, como hizo DeepSeek con las variantes más pequeñas de Qwen y Llama de R1. De cualquier modo, el cómputo de post-entrenamiento, antes una idea secundaria, es ahora un eje de escalamiento de primera clase junto al cómputo en tiempo de inferencia.
La seguridad también vive aquí
Casi todo lo que un usuario experimenta como seguridad es post-entrenamiento: comportamiento de rechazo, manejo de solicitudes peligrosas y robustez ante la presión de jailbreaks. Los laboratorios mezclan ejemplos de seguridad en SFT, añaden señales de inocuidad al modelo de recompensa y golpean los checkpoints con Red Teaming antes del lanzamiento; la IA Constitucional de Anthropic sustituye algunas etiquetas humanas de inocuidad por retroalimentación de IA contrastada con un conjunto escrito de principios. La calibración es la parte difícil — muy poco entrenamiento de seguridad y el modelo es peligroso; demasiado y rechaza investigaciones de seguridad, preguntas médicas y ficción oscura. Estos comportamientos también están cerca de la superficie: unos cientos de pasos de ajuste fino pueden eliminarlos de un modelo de pesos abiertos, una preocupación real para cada lanzamiento abierto.
Moldea más el comportamiento que el conocimiento
Una idea equivocada persistente es que el post-entrenamiento enseña hechos nuevos al modelo. En su mayor parte, no lo hace: la evidencia, incluida la hipótesis de alineación superficial detrás de trabajos como LIMA en 2023, sugiere que casi todo el conocimiento procede del preentrenamiento, mientras el post-entrenamiento principalmente expone, formatea y restringe lo que ya existe. Esto tiene consecuencias prácticas. Si a un modelo le falta una capacidad, un dataset SFT mayor rara vez la arregla — el conocimiento debe provenir del modelo base, o la etapa de RL necesita una tarea verificable donde el comportamiento pueda practicarse de verdad. También explica por qué confiar en el post-entrenamiento para cubrir carencias factuales es un plan arriesgado y por qué la recuperación o un modelo base distinto suelen ser la respuesta honesta.