Le lancement que nous n'avons pas couvert : Anthropic a sorti Claude Opus 5 le vendredi 24 juillet, et le chiffre qui compte est deux, le facteur de prix entre lui et le vaisseau amiral dont il suit la trace. Le positionnement d'Anthropic est 'proche de l'intelligence frontier de Claude Fable 5 à moitié prix', aux mêmes 5 dollars par million de tokens en entrée et 25 en sortie qu'Opus 4.8, avec un mode Fast au double du coût pour environ 2,5 fois la vitesse. C'est désormais le modèle par défaut de Claude Max, le plus fort de Pro, et il était disponible sur AWS Bedrock le jour même avec un contexte d'un million de tokens.
Les chiffres revendiqués, du billet de lancement d'Anthropic : nouvel état de l'art sur Frontier-Bench et GDPval-AA, un score CursorBench 3.2 à 0,5 % du pic de Fable 5 à moitié coût par tâche, un résultat OSWorld 2.0 au-dessus du meilleur de Fable 5 pour un peu plus du tiers du coût, et un score ARC-AGI-3 qu'Anthropic a décrit comme trois fois celui du meilleur modèle suivant, 30,2 % sur l'ensemble de tâches public. La lecture indépendante était plus aimable que le marketing : Artificial Analysis le place juste devant sur son Intelligence Index, 61 contre 60 pour Fable 5, à égalité de fait, et nettement devant sur AA-Briefcase, son benchmark agentique, 1 720 contre 1 574, avec un coût par tâche environ 20 % plus bas ; Epoch a mis son score en ingénierie logicielle à égalité avec Fable 5. Anthropic affirme aussi avoir délibérément évité d'entraîner Opus 5 sur des tâches cyber ; il reste loin derrière Mythos 5 sur ce terrain. Un détail souligné par Simon Willison dans la sortie : sur une tâche Frontier-Bench où il était impossible de voir le plan d'une pièce de machine, Opus 5 a écrit son propre pipeline de vision par ordinateur pour en extraire la géométrie des pixels bruts.
La réponse a pris cinq jours. Le 29 juillet, OpenAI a publié 'How enabling two settings tripled our scores on the ARC-AGI-3 benchmark' : GPT-5.6 Sol marque 13,3 % sur la ré-exécution du jeu de tâches public par OpenAI, contre 7,8 % au classement officiel, mais 38,3 %, au-dessus des 30,2 % d'Opus 5, une fois activés deux réglages de l'API Responses, retained reasoning, qui conserve le raisonnement privé entre les appels d'outils au lieu de le jeter, et compaction, qui résume les longs contextes au lieu de les tronquer. Mêmes poids de modèle, environ six fois moins de tokens en sortie, presque le triple du score. François Chollet d'ARC Prize a tracé la ligne là où vit désormais le débat : les harnais construits sur mesure pour un score sont exclus, les réglages d'API généralistes que tout client peut activer sont acceptés, et les chiffres d'OpenAI tiennent tant que les réglages et le coût sont clairement indiqués. Il a aussi reconnu la question de la parité : le harnais officiel jette le raisonnement que le modèle a lui-même produit, ce qui est un choix sur le test, pas sur les poids.
Classez donc les deux chiffres. Opus 5 a 30,2 % sur un harnais qui jette son raisonnement entre les étapes, et GPT-5.6 Sol a 38,3 % sur un harnais qui ne le jette pas, sont tous deux vrais, et ils ne décrivent pas le même test. La leçon utile de cette semaine de lancement n'est pas de savoir qui a gagné ; c'est que désormais, chaque résultat de benchmark frontier arrive en deux colonnes, le modèle et l'échafaudage autour, et la deuxième colonne devient celle qui fait bouger le chiffre. Quand un vendeur vous cite un score, la première question de suivi a désormais une forme fixe : avec quel harnais, et le sien.
