Le chiffre qui compte est 0,14 $ : le prix du million de tokens en entrée de V4-Flash-0731 de DeepSeek, publié le 31 juillet sur Hugging Face sous licence MIT sans restriction, la sortie à 0,28 $ le million, environ un tiers du niveau V4-Pro. La base est un mélange d'experts de 284 milliards de paramètres avec 13 milliards actives par token et une fenêtre de contexte d'un million de tokens ; le chiffre de 304 milliards de la fiche inclut le module brouillon de décodage spéculatif DSpark attaché. La ligne officielle est que l'architecture et la taille sont inchangées depuis l'aperçu et que les gains viennent d'un simple re-post-entraînement.

La mesure indépendante, et elle est délibérément petite : Simon Willison a lancé son test pélican standard via OpenRouter et a obtenu un pélican décevant au niveau de raisonnement par défaut et, selon ses mots, quelque chose de bien meilleur avec le raisonnement au maximum. Artificial Analysis classe le modèle devant le M3 de MiniMax, un modèle de 428 milliards, et le présente comme peut-être la meilleure valeur par intelligence disponible. Le tableau de benchmarks de DeepSeek est plus gros et se lit comme du marketing ; l'avertissement utile qui l'accompagne est celui de MarkTechPost : les scores d'agents dépendent du harnais, donc les exécutions indépendantes peuvent diverger. En raccourci de cette rédaction : beaucoup est revendiqué, peu est mesuré, et ce qui est mesuré est favorable. L'essayer soi-même reste bon marché à ces prix.

Le H3 de MiniMax, lancé le même jour, est l'autre moitié de la semaine. C'est un modèle vidéo omni-modal qui lit texte, images, vidéo et audio comme un contexte unifié, et son vrai diferenciant est le son stéréo natif : l'audio est une entrée de premier ordre, on peut donc lui donner un clip de référence et demander au personnage d'une image de le chanter, et il émet de l'audio stéréo avec la vidéo au lieu de dépendre d'un doublage séparé. La sortie est en 2K pour 4 à 15 secondes, durées entières seulement. Sous le capot : un schéma de sous-titrage qui distille environ 100 000 tokens de matériel source en 4 000, un nouveau VAE auquel il attribute un gain de 4x en longueur de séquence effective, et une étape de régénération en contexte au lieu d'un module de super-résolution greffé.

Les réserves sont la partie utile. H3 n'est aujourd'hui accessible que via l'API de MiniMax et l'application Hailuo ; les poids ouverts sont promis 'dans les jours qui viennent' et, à l'heure de publication, n'existent pas, ce qui est exactement le genre de promesse que cette rédaction valorise à zéro tant qu'elle n'est pas livrée. Les affirmations de prix sont celles de MiniMax (moins d'un tiers des modèles courants en 2K) ; les traqueurs tiers situent le paiement à l'usage autour de 0,13 $ la seconde, rapporté plutôt que confirmé. Et le South China Morning Post, citant Artificial Analysis, place H3 en tête du montage vidéo tout en le faisant suivre Gemini Omni Flash de Google en texte-vers-vidéo et Seedance 2.0 en image-vers-vidéo. Deux sorties, un motif : l'action intéressante dans les modèles cette semaine se joue aux marges, poids ouverts et vidéo, pas à la frontière fermée.