Le chiffre qui compte est de 284 milliards : les paramètres du squelette mixture-of-experts V4 Flash de DeepSeek, dont environ 13 milliards seulement s'activent pour une requête donnée. Ce squelette est la fondation de V4 Flash Vision Exp, le modèle agent multimodal que DeepSeek a dévoilé vendredi sur sa plateforme développeur payante. Le suffixe « Exp » fait honnêtement son travail : l'entreprise n'a publié aucune note d'architecture pour le nouveau modèle, et sa sortie habituelle en poids ouverts n'est pas confirmée, un revirement notable pour un laboratoire dont les lancements mènent d'habitude avec le checkpoint.
La feuille de benchmarks du vendeur est précise. Contre son propre prédécesseur, Vision Exp gagne six des sept benchmarks texte, la seule défaite venant de Cybergym, qui mesure la découverte de vulnérabilités logicielles. Les gains se concentrent là où le nom le dit : sur quatre benchmarks visuels, le modèle améliore V4 Flash de plus de 10 % sur deux, et SiliconANGLE rapporte qu'il bat aussi Opus 4.8 d'Anthropic sur ALE, une suite de plus de 1 000 tâches multi-étapes qui exigent d'interagir avec des applications, d'écrire du code et d'interpréter des médias, et sur ZeroBench, 100 tâches d'analyse d'images conçues pour être dures pour les modèles frontière. Rien de tout cela n'a encore été évalué indépendamment ; traitez les graphiques comme des affirmations jusqu'à ce que des runs tierces atterrissent.
En dessous se trouve l'ingénierie documentée par la fiche du modèle V4 Flash en avril : HCA et CSA, deux techniques de compression du cache KV qui réduisent d'environ trois quarts le calcul nécessaire pour les requêtes d'un million de tokens, un entraînement sur 32 000 milliards de tokens, et l'optimiseur Muon pour accélérer la calibration des couches cachées. Le plus grand V4 Pro de DeepSeek, avec plus de cinq fois les paramètres, est le candidat évident au même traitement vision si le schéma de Vision Exp se confirme.
Pour les développeurs, l'histoire est la direction prix-performance des agents computer-use. Un modèle agent lecteur d'écran venu d'un laboratoire avec la structure de coûts de DeepSeek bouscule l'hypothèse selon laquelle le travail d'agent visuel sérieux exige un budget flagship ; la couverture de Canaltech décrit exactement ce cas d'usage, des tâches résolues en regardant des écrans. Surveillez deux choses : si des benchmarks indépendants confirment les comparaisons avec Opus 4.8, et si les poids suivent, parce qu'un lecteur d'écran téléchargeable à 13 milliards de paramètres actifs ferait encore bouger le niveau des agents locaux, deux semaines après Muse Glimmer et Qwen 3.8.
