La cifra que importa es 0,14 $: el precio por millón de tokens de entrada de V4-Flash-0731 de DeepSeek, publicado el 31 de julio en Hugging Face bajo licencia MIT sin restricciones, con la salida a 0,28 $ el millón, cerca de un tercio de lo que cobra el nivel V4-Pro. La base es una mezcla de expertos de 284.000 millones de parámetros con 13.000 millones activados por token y una ventana de contexto de un millón de tokens; la cifra de 304.000 millones de la ficha incluye el módulo borrador de decodificación especulativa DSpark adjunto. La línea oficial es que la arquitectura y el tamaño no cambian desde la vista previa y que las ganancias vienen solo de un nuevo post-entrenamiento.
La medición independiente, y es deliberadamente pequeña: Simon Willison ejecutó su prueba estándar del pelícano a través de OpenRouter y obtuvo un pelícano decepcionante con el esfuerzo de razonamiento por defecto y, en sus palabras, algo mucho mejor con el razonamiento en alto. Artificial Analysis sitúa el modelo por delante del M3 de MiniMax, un modelo de 428.000 millones, y lo presenta como posiblemente el mejor valor por inteligencia disponible. La tabla de benchmarks de DeepSeek es más grande y se lee como marketing; la advertencia útil adjunta es la de MarkTechPost: las puntuaciones de agentes dependen del arnés, así que las ejecuciones independientes pueden divergir. En la taquigrafía de esta redacción: mucho se reivindica, poco se mide, y lo medido es favorable. Probarlo uno mismo sigue siendo barato a estos precios.
El H3 de MiniMax, lanzado el mismo día, es la otra mitad de la semana. Es un modelo de vídeo omni-modal que lee texto, imágenes, vídeo y audio como un contexto unificado, y su verdadero diferenciador es el sonido estéreo nativo: el audio es una entrada de primera clase, así que puedes darle un clip de referencia y pedirle al personaje de una imagen que lo cante, y emite audio estéreo con el vídeo en lugar de depender de una etapa de doblaje aparte. La salida es 2K de 4 a 15 segundos, solo duraciones enteras. Bajo el capó: un esquema de subtitulado que destila unos 100.000 tokens de material fuente a 4.000, un nuevo VAE al que atribuye una ganancia de 4x en longitud de secuencia efectiva, y un paso de regeneración en contexto en lugar de un módulo de super-resolucion acoplado.
Las salvedades son la parte útil. H3 hoy solo es alcanzable a través de la API de MiniMax y la aplicación Hailuo; los pesos abiertos están prometidos 'en los próximos días' y, al momento de publicar, no existen, que es exactamente el tipo de promesa que esta redacción valora en cero hasta que se entrega. Las afirmaciones de precio son de MiniMax (menos de un tercio de los modelos habituales en 2K); los rastreadores terceros sitúan el pago por uso en unos 0,13 $ por segundo, reportado más que confirmado. Y el South China Morning Post, citando Artificial Analysis, tiene a H3 liderando la edición de vídeo mientras sigue a Gemini Omni Flash de Google en texto-a-vídeo y a Seedance 2.0 en imagen-a-vídeo. Dos lanzamientos, un patrón: la acción interesante en modelos está semana ocurre en los bordes, pesos abiertos y vídeo, no en la frontera cerrada.
