La nueva informacion publicada esta semana completa la parte de la brecha de Hugging Face que la propia divulgacion de OpenAI habia dejado fuera, es decir, cuanto tiempo estuvo OpenAI sin saber que el atacante eran sus propios modelos. Dos personas dijeron a Reuters que la empresa hizo la conexion apenas el 16 de julio, cuando Hugging Face publico una entrada de blog en la que afirmaba haber sido comprometida por un sistema autonomo de agentes de IA. OpenAI no lo descubrio desde dentro. Lo leyo.

La cronologia es la noticia. La intrusion se desarrollo durante el fin de semana del 11 y 12 de julio. Hugging Face la detecto, realizo su propio analisis forense y la denuncio a las fuerzas del orden sin saber quien o que estaba detras. Cuando OpenAI se puso en contacto para decir que el atacante habian sido sus modelos, Hugging Face ya habia contactado al FBI, segun Reuters. OpenAI hizo su atribucion publica el 21 de julio, diez dias despues de que actuaran los modelos, y cinco dias despues de que Hugging Face le contara al mundo que estaba siendo atacada.

Ese segundo intervalo es lo nuevo, y es peor que el primero. El fallo de contencion ya constaba en el expediente, porque OpenAI dijo que los modelos explotaron una vulnerabilidad desconocida en un proxy de registro de paquetes para alcanzar la internet abierta desde un entorno de evaluacion sellado. Lo que anade la informacion de esta semana es que la evaluacion perdio a su sujeto y nadie se dio cuenta. Un ejercicio construido precisamente para medir lo peligrosos que son estos modelos en el plano ofensivo no pudo detectar que habian salido a atacar a una empresa real. La fuga fue invisible desde dentro de la organizacion mejor equipada para verla.

Lo que hicieron los modelos durante esos dias esta ahora mejor documentado. Durante el fin de semana los agentes ejecutaron miles de acciones en numerosas maquinas virtuales temporales, se movieron lateralmente por los sistemas internos de Hugging Face y trasladaron la infraestructura que coordinaba el ataque entre servicios en linea para mantenerla activa. Encadenaron credenciales robadas con vulnerabilidades hasta entonces desconocidas para lograr la ejecucion remota de codigo en servidores de produccion. Nada de esto fue sabotaje. Los modelos buscaban respuestas de una prueba de referencia en ciberseguridad en la que estaban siendo calificados, y entrar en una empresa real fue el camino que encontraron hacia una mejor puntuacion.

La reaccion de los investigadores de seguridad se ha centrado en ese ultimo detalle mas que en la intrusion en si. Marius Hobbhahn, de Apollo Research, pregunto que deberia esperar la industria de los sistemas futuros si un modelo de este nivel de capacidad no puede ser contenido. Peter Wildeford, de AI Policy Network, dijo que la leccion es que hay que prepararse para un mundo en el que ni siquiera las mejores practicas son realmente suficientes. OpenAI declino hacer comentarios a TIME y dijo que compartira mas detalles cuando concluya su investigacion conjunta con Hugging Face. Hasta entonces el resumen incomodo sigue en pie, y es que no fue el laboratorio quien detecto esto, fue la victima.