Le chiffre qui compte est de 30 milliards : le nombre de paramètres de Muse Glimmer, le modèle dense, multimodal et sous licence Apache 2.0 que Meta a publié le 10 août comme son retour aux poids ouverts. Distillé du flagship Muse en un décodeur de texte de 28 milliards de paramètres avec un encodeur vision de 2 milliards, il vise carrément le travail local et agentique : codage, analyse de documents, assistants personnels, et les configurations d'agents auto-hébergées qui ont défini la scène local-first cette année. L'argument est la vie privée et le coût, mais le sous-texte est plus grand : c'est le cadre de la superintelligence personnelle de Meta rendu téléchargeable.
Sur les chiffres publiés, repris par le billet de lancement de Hugging Face, Muse Glimmer mène la catégorie des 30 milliards sur la plupart des mesures agentiques : 75,5 sur MCP Atlas, 51,2 sur SWE-Bench Pro, 43,3 sur GAIA2, 94,7 sur AIME 2026 et 83,5 sur GPQA Diamond, devançant pour l'essentiel Gemma 4 31B et Qwen 3.6 27B dans les tableaux comparatifs. La réserve est arrivée à l'heure. Qwen 3.8 27B d'Alibaba a atterri quatre jours plus tard et a repris une bonne partie de la catégorie, ce que les praticiens ont résumé ainsi : Muse Glimmer a été la frontière de sa catégorie de poids pendant exactement quatre jours. Ce n'est pas un échec du modèle ; c'est le tempo du niveau local désormais, et les acheteurs feraient bien de le prévoir.
L'histoire du déploiement est la partie la plus forte. Le support jour zéro couvre transformers, llama.cpp, vLLM et Hugging Face Inference Endpoints, Meta distribue des quants calibrés et Unsloth en publie d'optimisés, et un drafter de décodage spéculatif DFlash, en option, accélère la génération structurée comme le code. L'architecture mise sur l'efficacité de service : l'attention groupée avec seize têtes de requête par tête clé-valeur divise par seize la mémoire du cache KV, et la pile d'attention hybride alterne couches à fenêtre glissante et couches pleines sur 52 couches. Le matériel d'entrée réaliste est une seule H100 de 80 gigaoctets pour l'inférence en pleine précision, les quants communautaires descendent bien plus bas, et le chemin ExecuTorch de Meta vise directement téléphones et portables.
Pour les développeurs, le cadre qui compte n'est pas le record de quatre jours mais le plancher qu'il a déplacé. Il y a un an, modèle local signifiait un compromis toléré pour la vie privée ; l'argument de Muse Glimmer, et la réponse que Qwen 3.8 lui a faite, c'est que le compromis se mesure désormais en points de benchmark plutôt qu'en classes de capacité. Meta investit visiblement dans l'écosystème autour des poids : le billet Hugging Face livre des démos où le modèle se quantifie lui-même, se déploie lui-même sur un endpoint et optimise sa propre pile de service, visant exactement les développeurs d'agents qui décideront si cette sortie tient. Si votre produit suppose que les utilisateurs ne peuvent pas faire tourner de sérieux modèles sur leur propre matériel, cette hypothèse a expiré ce mois-ci.
