Le chiffre qui compte est un : le premier modèle qu'OpenAI n'a jamais pu exclure de son niveau de risque cyber le plus élevé. Dans un billet vendredi, l'entreprise a dit que les évaluations internes d'Astra, son prochain modèle, montraient des performances assez fortes en codage agentique et cybersécurité pour qu'elle ne puisse plus exclure le niveau Critical de son Preparedness Framework, le système de notation de sécurité qu'elle applique depuis 2023. Critical, selon le texte du cadre, signifie un modèle assisté d'outils capable de trouver et développer des zero-day fonctionnels de toute sévérité dans de nombreux systèmes réels critiques et durcis sans intervention humaine, ou capable de concevoir et exécuter des stratégies inédites de cyberattaque de bout en bout contre des cibles durcies à partir d'un objectif seulement grossièrement défini. Tous les modèles OpenAI précédents, GPT-5.6 Sol inclus, plafonnaient à High.

Le déclencheur est une lecture de capacité, pas un incident. OpenAI dit que les évaluations des derniers jours ont retourné des 'avancées significatives' en codage agentique et cybersécurité, et dit clairement qu'Astra, un modèle à venir, n'a pas été impliqué dans l'exploitation de Hugging Face. Le texte du cadre pour Critical dit que le développement s'arrête jusqu'à ce que des standards de sécurité à la hauteur soient spécifiés, et les actions d'OpenAI restent juste en deçà de cette ligne : elle met en pause les activités internes Astra qui ne satisfont pas encore les garde-fous renforcés, isole les environnements de test, restreint l'accès réseau et outils, durcit et chiffre les poids du modèle, et fait tourner un moniteur universel sur chaque usage agentique d'Astra, entraînement et évaluation compris, avec des moniteurs de Chain-of-Thought qui interrompent l'activité à haut risque. Des agences gouvernementales et des organisations de sécurité IA sélectionnées sont appelées pour tester le modèle, et les partenaires de test tiers reçoivent des contrôles recommandés pour les évaluations à haut risque.

Sam Altman a confirmé la conséquence pratique sur X : le lancement prendra 'un petit peu plus longtemps pour un déploiement sûr, mais espérons pas trop longtemps'. Dans le même message, il a visé Anthropic, qui ne livre son modèle le plus puissant, Mythos, qu'à des partenaires et gouvernements sélectionnés : 'Nous ne pensons pas que ce soit une bonne stratégie de ne mettre les modèles capables qu'à la disposition de quelques puissants.' Le chercheur d'OpenAI Noam Brown, dans ses propres messages, a appelé à prendre l'incident Hugging Face au sérieux, le comparant à l'histoire de 2017 où l'IA de Facebook aurait inventé sa propre langue, un récit qui s'est révélé gonflé. Celui-ci, a-t-il écrit, n'est pas ça, et il a lié l'inquiétude au test-time compute, arguant que les modèles actuels peuvent être poussés bien plus loin avant tout plateau.

La pesée qui compte tient entre deux phrases vraies. La première : c'est un potentiel, pas une classification. OpenAI dit ne plus pouvoir exclure Critical ; elle n'a pas classé Astra Critical, et si le niveau n'est jamais atteint, l'entreprise aura fait beaucoup d'attention pour un modèle qu'elle sortira quand même. Le Decoder s'attend à ce que l'accusation de marketing de la peur suive, et l'accusation porte une prédiction : si c'est de la publicité, la pause finira discrètement quand le cycle sera passé. La seconde : un cadre n'est réel que quand il coûte quelque chose, et cette semaine il a coûté une fenêtre de lancement et un aveu public, à caméra ouverte, que le prochain modèle de l'entreprise pourrait être trop capable pour être publié à l'heure. À regarder à partir d'ici : si OpenAI publie la notation finale quand elle existe, et si Anthropic et Google doivent maintenant répondre à la question de noter leurs propres modèles frontier en public, avec le même langage de cadre ou sans.