Le lancement que nous n'avons pas couvert : Anthropic a sorti Claude Opus 5 le vendredi 24 juillet, et le chiffre qui compte est deux, le facteur de prix entre lui et le vaisseau amiral dont il suit la trace. Le positionnement d'Anthropic est 'proche de l'intelligence frontier de Claude Fable 5 a moitie prix', aux memes 5 dollars par million de tokens en entree et 25 en sortie qu'Opus 4.8, avec un mode Fast au double du cout pour environ 2,5 fois la vitesse. C'est desormais le modele par defaut de Claude Max, le plus fort de Pro, et il etait disponible sur AWS Bedrock le jour meme avec un contexte d'un million de tokens.

Les chiffres revendiques, du billet de lancement d'Anthropic : nouvel etat de l'art sur Frontier-Bench et GDPval-AA, un score CursorBench 3.2 a 0,5 % du pic de Fable 5 a moitie cout par tache, un resultat OSWorld 2.0 au-dessus du meilleur de Fable 5 pour un peu plus du tiers du cout, et un score ARC-AGI-3 qu'Anthropic a decrit comme trois fois celui du meilleur modele suivant, 30,2 % sur l'ensemble de taches public. La lecture independante etait plus aimable que le marketing : Artificial Analysis le place juste devant sur son Intelligence Index, 61 contre 60 pour Fable 5, a egalite de fait, et nettement devant sur AA-Briefcase, son benchmark agentique, 1 720 contre 1 574, avec un cout par tache environ 20 % plus bas ; Epoch a mis son score en ingenierie logicielle a egalite avec Fable 5. Anthropic affirme aussi avoir deliberement evite d'entrainer Opus 5 sur des taches cyber ; il reste loin derriere Mythos 5 sur ce terrain. Un detail souligne par Simon Willison dans la sortie : sur une tache Frontier-Bench ou il etait impossible de voir le plan d'une piece de machine, Opus 5 a ecrit son propre pipeline de vision par ordinateur pour en extraire la geometrie des pixels bruts.

La reponse a pris cinq jours. Le 29 juillet, OpenAI a publie 'How enabling two settings tripled our scores on the ARC-AGI-3 benchmark' : GPT-5.6 Sol marque 13,3 % sur la re-execution du jeu de taches public par OpenAI, contre 7,8 % au classement officiel, mais 38,3 %, au-dessus des 30,2 % d'Opus 5, une fois actives deux reglages de l'API Responses, retained reasoning, qui conserve le raisonnement prive entre les appels d'outils au lieu de le jeter, et compaction, qui resume les longs contextes au lieu de les tronquer. Memes poids de modele, environ six fois moins de tokens en sortie, presque le triple du score. Francois Chollet d'ARC Prize a trace la ligne la ou vit desormais le debat : les harnais construits sur mesure pour un score sont exclus, les reglages d'API generalistes que tout client peut activer sont acceptes, et les chiffres d'OpenAI tiennent tant que les reglages et le cout sont clairement indiques. Il a aussi reconnu la question de la parite : le harnais officiel jette le raisonnement que le modele a lui-meme produit, ce qui est un choix sur le test, pas sur les poids.

Classez donc les deux chiffres. Opus 5 a 30,2 % sur un harnais qui jette son raisonnement entre les etapes, et GPT-5.6 Sol a 38,3 % sur un harnais qui ne le jette pas, sont tous deux vrais, et ils ne decrivent pas le meme test. La lecon utile de cette semaine de lancement n'est pas de savoir qui a gagne ; c'est que desormais, chaque resultat de benchmark frontier arrive en deux colonnes, le modele et l'echafaudage autour, et la deuxieme colonne devient celle qui fait bouger le chiffre. Quand un vendeur vous cite un score, la premiere question de suivi a desormais une forme fixe : avec quel harnais, et le sien.