OpenAI construyó una IA cuyo único trabajo es atacar los propios modelos de OpenAI, y resulta ser inquietantemente buena en ello. Llamado GPT-Red, el sistema es un red-teamer automatizado que caza vulnerabilidades de inyección de prompt (prompt injection), y en las propias evaluaciones de la compañía tuvo éxito en el 84 por ciento de los escenarios de ataque que nunca había visto antes, frente a apenas el 13 por ciento de los red-teamers humanos en las mismas tareas. OpenAI usó lo que GPT-Red destapó para reforzar su modelo GPT-5.6 y, de forma reveladora, ha decidido no lanzar al atacante en absoluto.

La forma en que fue construida es una gran parte de la historia. GPT-Red fue entrenado mediante aprendizaje por refuerzo en self-play, un esquema en el que dos lados del mismo sistema compiten y se perfeccionan mutuamente. Un modelo atacante genera ataques de inyección de prompt cada vez más ingeniosos, la técnica de engañar a un modelo para que siga instrucciones enterradas en el contenido que está procesando en lugar de la petición real del usuario, mientras un modelo defensor aprende a ignorarlos. Ronda tras ronda ambos se vuelven más fuertes, y el atacante termina explorando rincones del comportamiento del modelo que los evaluadores humanos quizá nunca pensarían en probar.

Los resultados son lo esencial. Con espacio para explorar por su cuenta, GPT-Red descubrió una clase de ataque que OpenAI llama fake chain of thought (falsa cadena de razonamiento), que inserta pasos de razonamiento falsos que el modelo trata como ya verificados y por tanto acepta. Retroalimentar esos descubrimientos al entrenamiento dio frutos de forma medible, los ataques que funcionaban en el antiguo GPT-5 más del 90 por ciento de las veces ahora tienen éxito menos del 23 por ciento de las veces contra GPT-5.6. En términos sencillos, el atacante de IA hizo que el modelo lanzado fuera mucho más difícil de secuestrar.

Lo más llamativo es la decisión sobre lo que no se debe hacer con él. OpenAI dice que GPT-Red no es un producto y no será lanzado, y que se mantiene separado de los modelos que la gente usa de verdad, para que las capacidades de ataque que desarrolla no puedan salir a la luz. Es una admisión franca de que una herramienta tan buena rompiendo IA es peligrosa en las manos equivocadas, y una ventana clara al dilema de doble uso en el centro de la seguridad de la IA, la misma habilidad que parcha un sistema puede darse la vuelta para forzarlo y abrirlo.

Lo que está en juego va más allá de un solo modelo. La inyección de prompt está entre los problemas sin resolver más peliagudos del campo, porque los agentes que leen tu correo, navegan por la web o ejecutan código pueden ser secuestrados por instrucciones ocultas en cualquier cosa que lleguen a tocar, y defenderse de eso a mano es una carrera que los humanos siguen perdiendo. GPT-Red apunta hacia dónde se dirigen las cosas, dejando que la IA encuentre las fallas de la IA más rápido de lo que podría cualquier equipo humano y luego incorporando esas lecciones en defensas más sólidas. Es una señal alentadora de que la carrera armamentista puede librarse con fuerza desde el lado defensivo. También es un recordatorio de que las herramientas de seguridad más capaces y las herramientas de ataque más capaces son cada vez más una y la misma, que es precisamente por lo que esta se mantiene bajo llave.