La cifra que importa es uno: el primer modelo que OpenAI no ha podido descartar de su nivel de riesgo cibernético más alto. En un blog el viernes, la empresa dijo que las evaluaciones internas de Astra, su próximo modelo, mostraban un rendimiento lo bastante fuerte en codificación agéntica y ciberseguridad como para no poder descartar el nivel Critical de su Preparedness Framework, el sistema de calificación de seguridad que aplica desde 2023. Critical, según el texto del marco, significa un modelo asistido por herramientas capaz de encontrar y desarrollar exploits zero-day funcionales de cualquier severidad en muchos sistemas reales críticos y endurecidos sin intervención humana, o capaz de idear y ejecutar estrategias inéditas de ciberataque de extremo a extremo contra objetivos endurecidos a partir de una meta solo aproximadamente definida. Todos los modelos anteriores de OpenAI, incluido GPT-5.6 Sol, se quedaban en High como máximo.

El detonante es una lectura de capacidad, no un incidente. OpenAI dice que las evaluaciones de los últimos días devolvieron 'avances significativos' en codificación agéntica y ciberseguridad, y dice claramente que Astra, un modelo venidero, no estuvo implicada en la explotación de Hugging Face. El texto del marco para Critical dice que el desarrollo se detiene hasta que se especifiquen estándares de seguridad a la altura, y las acciones de OpenAI se quedan justo cortas de esa línea: está pausando las actividades internas de Astra que aún no cumplen las salvaguardas reforzadas, aislando los entornos de prueba, restringiendo el acceso a red y herramientas, endureciendo y cifrando los pesos del modelo, y corriendo un monitor universal sobre cada uso agéntico de Astra, entrenamiento y evaluación incluidos, con monitores de Chain-of-Thought que interrumpen la actividad de alto riesgo. Agencias gubernamentales y organizaciones selectas de seguridad de IA son llamadas a probar el modelo, y los socios de prueba terceros reciben controles recomendados para evaluaciones de alto riesgo.

Sam Altman confirmó la consecuencia práctica en X: el lanzamiento tomará 'un poquito más de tiempo para un despliegue seguro, pero ojalá no demasiado'. En el mismo mensaje apuntó a Anthropic, que solo entrega su modelo más potente, Mythos, a socios y gobiernos seleccionados: 'No creemos que sea una buena estrategia poner los modelos capaces solo a disposición de unos pocos poderosos.' El investigador de OpenAI Noam Brown, en sus propios mensajes, pidió tomar en serio el incidente de Hugging Face, comparándolo con la historia de 2017 en la que la IA de Facebook supuestamente inventó su propio idioma, un relato que resultó inflado. Este, escribió, no es eso, y vinculó la preocupación al test-time compute, argumentando que los modelos actuales pueden empujarse mucho más lejos antes de cualquier meseta.

La sopesa que importa está entre dos frases ciertas. La primera: esto es un potencial, no una clasificación. OpenAI dice que ya no puede descartar Critical; no ha calificado a Astra como Critical, y si el nivel nunca se alcanza, la empresa habrá hecho mucha atención de un modelo que de todos modos lanzará. The Decoder espera que la acusación de marketing del miedo siga, y la acusación lleva una predicción adjunta: si es publicidad, la pausa terminará discretamente cuando pase el ciclo. La segunda: un marco solo es real cuando cuesta algo, y esta semana costó una ventana de lanzamiento y una admisión pública, a cámara abierta, de que el próximo modelo de la empresa podría ser demasiado capaz para publicarse a tiempo. A vigilar desde aquí: si OpenAI publica la calificación final cuando exista, y si Anthropic y Google afrontan ahora la pregunta de calificar a sus propios modelos frontier en público, con el mismo lenguaje de marco o sin él.