La cifra que importa es 284.000 millones: los parámetros dentro del espinazo mixture-of-experts V4 Flash de DeepSeek, del que solo unos 13.000 millones se activan para cada solicitud. Ese espinazo es la base de V4 Flash Vision Exp, el modelo agente multimodal que DeepSeek presentó el viernes en su plataforma de desarrollo de pago. La etiqueta "Exp" trabaja con honestidad: la empresa no ha publicado notas de arquitectura del nuevo modelo, y su habitual entrega de pesos abiertos no está confirmada, un giro notable para un laboratorio cuyos lanzamientos suelen abrir con el checkpoint.
La hoja de benchmarks del vendedor es específica. Contra su propio predecesor, Vision Exp gana seis de siete benchmarks de texto, con la única derrota en Cybergym, que mide el descubrimiento de vulnerabilidades de software. Las mejoras se concentran donde dice el nombre: en cuatro benchmarks visuales, el modelo mejora a V4 Flash en más del 10 por ciento en dos, y SiliconANGLE reporta que también supera a Opus 4.8 de Anthropic en ALE, una suite de más de 1.000 tareas de varios pasos que exigen interactuar con aplicaciones, escribir código e interpretar medios, y en ZeroBench, 100 tareas de análisis de imágenes diseñadas para ser duras para modelos de frontera. Nada de esto ha sido evaluado independientemente todavía; traten las gráficas como afirmaciones hasta que lleguen corridas de terceros.
Debajo está la ingeniería que la ficha del modelo V4 Flash documentó en abril: HCA y CSA, dos técnicas de compresión del caché KV que recortan en unas tres cuartas partes el cómputo necesario para solicitudes de un millón de tokens, entrenamiento sobre 32 billones de tokens, y el optimizador Muon para acelerar la calibración de las capas ocultas. El mayor V4 Pro de DeepSeek, con más de cinco veces los parámetros, es el candidato obvio para el mismo tratamiento de visión si el patrón de Vision Exp se sostiene.
Para quienes construyen, la historia es la dirección precio-rendimiento de los agentes de computer-use. Un modelo agente lector de pantalla de un laboratorio con la estructura de costes de DeepSeek presiona la suposición de que el trabajo serio de agentes visuales exige un presupuesto insignia; la cobertura de Canaltech describe exactamente ese caso de uso, tareas resueltas mirando pantallas. Vigilen dos cosas: si benchmarks independientes confirman las comparaciones con Opus 4.8, y si los pesos llegan, porque un lector de pantalla descargable con 13.000 millones de parámetros activos movería otra vez el nivel de los agentes locales, dos semanas después de Muse Glimmer y Qwen 3.8.
