La cifra que importa es seis: las funciones de un juego que el nuevo agente de código de Meta construyó simultáneamente en pruebas, en paralelo, sin colisiones, según el propio relato de Mark Zuckerberg. Muse Code, lanzado en beta el 5 de agosto, es la entrada de Meta en la carrera de los agentes de código en terminal: una herramienta de línea de comandos que planifica cambios, escribe código y valida resultados en repositorios grandes, corriendo sobre el nuevo modelo Muse Spark 1.2, e instalable con un comando.
La mecánica que lo separa de una envoltura de chat es el abanico. Cuando el trabajo es lo bastante grande, Muse Code lanza sub-agentes paralelos trabajando en worktrees aislados, así que la copia de trabajo del usuario nunca se toca hasta que el trabajo está listo para fusionarse. Es la misma respuesta arquitectónica que los worktrees de Git dieron a los humanos, ahora aplicada a los agentes, y es la primera vez que un gran laboratorio la entrega por defecto en lugar de como opción. La afirmación de las seis funciones de Zuckerberg es una demostración del vendedor, no una medición independiente, y ninguna cifra pública de benchmark acompañaba a la beta, así que el estado honesto de la evidencia es: el diseño es correcto, la prueba está pendiente.
El posicionamiento es la parte a leer dos veces. Meta llega tarde a una carrera donde Codex de OpenAI y Claude Code de Anthropic ya tienen a los desarrolladores, y el argumento de Alexandr Wang, jefe de IA de Meta, al Wall Street Journal no fue ganar benchmarks sino el coste: 'para muchos flujos de trabajo y muchos casos de uso, esta puede ser una opción increíblemente buena, especialmente desde la perspectiva del coste.' Es un argumento de precio primero en una categoría que ha sido benchmark primero todo el año, y empareja con la entrada de Meta en junio a los agentes de IA empresariales para servicio al cliente. Meta no intenta batir los números de los incumbentes; intenta ser la que puedes permitirte correr en permanencia.
Para quienes la evalúan esta semana, la checklist es corta. El abanico en worktrees merece probarse en tu propio repositorio, no en la demo. La afirmación de coste necesita tu propia factura de tokens, porque 'asequible' depende de cuántos sub-agentes lanza el abanico en una tarea real. Y la pregunta abierta es la que el lanzamiento no respondió: cómo se compara Muse Spark 1.2 con los modelos actuales de Codex y Claude Code sobre la misma base de código, una medición que la comunidad hará pública en días, y en la que esta redacción confiará más que en la keynote.
