Saltar al contenido principal
Zubnet AIAprenderWiki › GPT
Modelos

GPT

También conocido como: ChatGPT, GPT-4, GPT-5
GPT (Generative Pre-trained Transformer) es la familia de grandes modelos de lenguaje de OpenAI: transformers de tipo decoder-only entrenados para predecir el siguiente token y posteriormente alineados para chat y razonamiento. La línea abarca desde GPT-1 (2018), con 117 millones de parámetros, pasando por GPT-4 y el multimodal GPT-4o, hasta GPT-5 (agosto de 2025), e impulsa tanto el producto ChatGPT como la API de OpenAI.

Por qué importa

GPT es la familia que llevó los grandes modelos de lenguaje al gran público: ChatGPT alcanzó aproximadamente 100 millones de usuarios en los dos meses posteriores a su lanzamiento, y la API se convirtió en la infraestructura predeterminada para una generación de productos. La trayectoria de la familia — escalamiento, RLHF, multimodalidad, razonamiento en tiempo de inferencia — es, en la práctica, una historia condensada del desarrollo moderno de los LLM, por lo que entender GPT es un atajo para entender el campo.

En profundidad

La historia de GPT es en realidad la superposición de tres historias. La primera es una historia de escalamiento: a partir de GPT-1 en 2018, con 117 millones de parámetros, OpenAI demostró que un Transformer entrenado para predecir el siguiente token sobre suficiente texto en bruto se convierte en un sistema de lenguaje de propósito general sorprendentemente capaz, y cada generación — GPT-2, GPT-3, GPT-4 — logró grandes saltos de capacidad principalmente mediante más cómputo y datos. La segunda es una historia de alineación: los predictores en bruto del siguiente token son incómodos de usar, así que OpenAI añadió Instruction Tuning y retroalimentación humana, y convirtió un motor de completado de texto en el asistente de chat que hizo famosa a la familia. La tercera es una historia de unificación: los lanzamientos recientes incorporan la multimodalidad y el razonamiento deliberado paso a paso en un único modelo insignia, de modo que "GPT" ahora designa toda una línea de productos y no una sola arquitectura.

El arco inicial: de GPT-1 a GPT-3

GPT-1 (2018) presentó la receta en un artículo de título modesto, "Improving Language Understanding by Generative Pre-Training": preentrenar un transformer de tipo decoder-only sobre un corpus grande sin etiquetar y luego aplicarle ajuste fino para cada tarea. Con 117 millones de parámetros, era una prueba de concepto, pero la prueba funcionó. GPT-2 (2019, 1.500 millones de parámetros) amplió la receta y mostró que un solo modelo podía realizar tareas para las que nunca había sido entrenado explícitamente — traducción, resumen, respuesta a preguntas — con solo leer un prompt bien formulado; OpenAI retuvo inicialmente los pesos completos por temor al uso indebido, un anticipo temprano de cada debate sobre lanzamientos desde entonces. GPT-3 (2020, 175.000 millones de parámetros) escaló otras cien veces y volvió el truco lo bastante fiable como para convertirlo en producto: dale al modelo unos pocos ejemplos en el prompt y capta el patrón, un comportamiento conocido como Few-Shot. Igual de importante fue que GPT-3 se ofreció como una API comercial en lugar de como pesos descargables, estableciendo el modelo de acceso que todavía siguen la mayoría de los laboratorios de frontera.

ChatGPT y el giro hacia RLHF

Un modelo GPT base no responde preguntas — continúa texto, así que es tan probable que añada más preguntas a tu lista como que las responda. InstructGPT (2022) resolvió esto con RLHF: etiquetadores humanos clasificaron salidas del modelo, un modelo de recompensa aprendió sus preferencias y el modelo de lenguaje recibió ajuste fino contra esa recompensa hasta que siguió instrucciones de manera fiable. ChatGPT, lanzado en noviembre de 2022, envolvió un modelo de clase GPT-3.5 ajustado de esta forma en una interfaz de chat gratuita, y alcanzó aproximadamente 100 millones de usuarios en unos dos meses — en ese momento, la aplicación de consumo de crecimiento más rápido jamás medida. La lección que extrajo la industria fue incómoda para quienes creían únicamente en el escalamiento: el modelo apenas había cambiado, pero la capa de alineación y la interfaz sí, y eso bastó para convertir una demostración de investigación en un producto de mercado masivo.

GPT-4, la serie o y GPT-5

GPT-4 (2023) fue la generación que hizo creíble a la familia para el trabajo profesional — un gran salto en calidad de razonamiento, seguimiento de instrucciones y fiabilidad, con entrada de imágenes además de texto. GPT-4o (2024) volvió al modelo nativamente Multimodal: una sola red que maneja texto, imágenes y audio de extremo a extremo, más rápida y barata que su predecesora, lo cual permitió el modo de voz en tiempo real. En paralelo, OpenAI separó la serie o (o1 y luego o3): modelos entrenados con aprendizaje por refuerzo para gastar más tokens pensando antes de responder, intercambiando latencia por precisión en matemáticas, código y ciencia — la idea del Cómputo en tiempo de inferencia tomada en serio. GPT-5 (agosto de 2025) volvió a fusionar ambas ramas en un solo sistema que enruta cada solicitud entre un modelo conversacional rápido y un modelo de razonamiento más lento, para que los usuarios ya no tengan que elegir entre "inteligente pero lento" y "rápido pero superficial".

ChatGPT no es GPT

Los términos se usan indistintamente, pero designan cosas distintas, y confundirlos provoca errores reales al razonar sobre el comportamiento. GPT es la familia de modelos: los pesos a los que llamas mediante la API, con una ventana de contexto fija, un prompt de sistema que tú controlas y sin memoria entre llamadas a menos que la construyas. ChatGPT es un producto: uno de esos modelos más un Prompt de sistema, memoria de conversación, navegación web, herramientas para archivos y capas de moderación, todo lo cual da forma a lo que ves incluso antes de que el modelo se ejecute. Cuando alguien informa que "GPT se negó" o "GPT recordó", el comportamiento suele provenir de la envoltura del producto y no del modelo base — algo que importa cuando trasladas un prompt de la aplicación a la API y las respuestas cambian. Una segunda confusión, más leve: "GPT" ha pasado a usarse de manera genérica para cualquier chatbot, del mismo modo que "Kleenex" significa cualquier pañuelo desechable, pero en sentido estricto se refiere únicamente a la familia de OpenAI; Llama, Claude y Gemini no son GPT.

Bajo el capó

En términos de arquitectura, cada GPT es un transformer de tipo Decoder: el texto de entrada se tokeniza, se convierte en embeddings y pasa por una pila de capas de auto-atención, y el entrenamiento ajusta los pesos para minimizar el error de predicción del siguiente token sobre un corpus de texto enorme. No hay encoder ni objetivo de token enmascarado — ese es el contraste clave con BERT, la otra famosa línea de transformers, que lee texto de forma bidireccional y se creó para tareas de comprensión en lugar de generación. Como todo lo que sabe el modelo queda incorporado en los pesos durante el preentrenamiento, tiene una Fecha de Corte del Conocimiento rígida y ninguna noción integrada de la verdad, por lo que puede afirmar falsedades con fluidez; proporcionarle contexto factual y reciente en el momento de la inferencia mediante RAG es la solución habitual. La generación misma es autoregresiva: el modelo muestrea un token, lo añade y repite el proceso, así que las respuestas largas son literalmente cientos de predicciones secuenciales.

← Todos los términos
ESC