El lanzamiento que no cubrimos: Anthropic saco Claude Opus 5 el viernes 24 de julio, y la cifra que importa es dos, el factor de precio entre el y el buque insignia al que sombrea. El posicionamiento de Anthropic es 'cercano a la inteligencia frontier de Claude Fable 5 a mitad de precio', a los mismos 5 dólares por millon de tokens de entrada y 25 de salida que Opus 4.8, con un modo Fast al doble de coste por unas 2,5 veces la velocidad. Ahora es el modelo por defecto en Claude Max, el más fuerte en Pro, y estuvo disponible en AWS Bedrock el mismo día con un contexto de un millon de tokens.
Las cifras reclamadas, del articulo de lanzamiento de Anthropic: nuevo estado del arte en Frontier-Bench y GDPval-AA, una puntuación en CursorBench 3.2 dentro del 0,5 % del pico de Fable 5 a mitad de coste por tarea, un resultado en OSWorld 2.0 por encima del mejor de Fable 5 a poco más de un tercio del coste, y una puntuación en ARC-AGI-3 que Anthropic describio como el triple del siguiente mejor modelo, 30,2 % en el conjunto público de tareas. La lectura independiente fue más amable que el marketing: Artificial Analysis lo pone justo por delante en su Intelligence Index, 61 a 60 de Fable 5, en empate de hecho, y claramente por delante en AA-Briefcase, su benchmark agentico, 1.720 a 1.574, con un coste por tarea alrededor de un 20 % menor ; Epoch puso su puntuación de ingeniería de software a la par de Fable 5. Anthropic también afirma que evito deliberadamente entrenar a Opus 5 en tareas cibernéticas; sigue bien detras de Mythos 5 en ese terreno. Un detalle que destacó Simon Willison del lanzamiento: en una tarea de Frontier-Bench sin forma de ver el plano de una pieza de máquina, Opus 5 escribio su propio pipeline de visión por computadora para extraer la geometría de los pixeles crudos.
La respuesta tardo cinco días. El 29 de julio, OpenAI público 'How enabling two settings tripled our scores on the ARC-AGI-3 benchmark': GPT-5.6 Sol marca 13,3 % en la re-ejecución del conjunto público por la propia OpenAI, frente al 7,8 % de la tabla oficial, pero 38,3 %, por encima del 30,2 % de Opus 5, una vez activados dos ajustes de la API Responses, retained reasoning, que conserva el razonamiento privado entre llamadas a herramientas en lugar de descartarlo, y compaction, que resume contextos largos en lugar de truncarlos. Mismos pesos del modelo, unas seis veces menos tokens de salida, casi el triple de puntuación. François Chollet, de ARC Prize, trazo la linea donde vive ahora el debate: los arneses hechos a medida para una puntuación quedan fuera, los ajustes de API de propósito general que cualquier cliente puede activar quedan dentro, y las cifras de OpenAI se sostienen mientras los ajustes y el coste se indiquen con claridad. También reconoció la cuestión de paridad: el arnés oficial descarta razonamiento que el propio modelo produjo, lo que es una decisión sobre la prueba, no sobre los pesos.
Archiven, pues, las dos cifras. Opus 5 con 30,2 % en un arnés que tira su razonamiento entre pasos, y GPT-5.6 Sol con 38,3 % en uno que no lo tira, son ambas verdaderas, y no describen la misma prueba. La lección útil de está semana de lanzamiento no es quien ganó; es que de ahora en adelante, cada resultado de benchmark frontier llega en dos columnas, el modelo y el andamiaje a su alrededor, y la segunda columna se está convirtiendo en la que mueve la cifra. Cuando un vendedor te cite una puntuación, la primera pregunta de seguimiento ya tiene forma fija: con que arnés, y de quien.
