L'écart entre les modèles publiés et les machines que possèdent la plupart des gens, c'est tout le problème des poids ouverts cette année. Deux sorties cette semaine le rétrécissent par les deux bouts.

FreeToken, paru vendredi, est ce que son README appelle un moteur de service mixture-of-experts natif de la périphérie, signé par des chercheurs de UC Berkeley et du MIT avec Ion Stoica, Matei Zaharia, Song Han et Kurt Keutzer parmi les auteurs, sous Apache 2.0 sur GitHub comme FlashML-org/FreeToken, article à arXiv 2608.16157. L'idée est l'ordonnancement plutôt que la compression. Le déchargement statique des experts bloque le GPU dès qu'un expert nécessaire n'est pas résident ; FreeToken emploie donc ce que l'article nomme une politique q étoile, répartissant le calcul de chaque jeton entre les cœurs du CPU et les cœurs tensoriels du GPU selon le débit PCIe mesuré, avec un format de poids rapide et un double tampon sur toute la couche pour que la diffusion des poids chevauche le calcul, et un gestionnaire de mémoire élastique qui déplace la VRAM entre le cache KV et les emplacements d'experts pendant l'exécution. InfoQ rapporte les chiffres : Qwen3.6-35B à environ 39 jetons par seconde sur un portable RTX 4060 de 8 Go, DeepSeek-V4-Flash à 284 milliards de paramètres sur un ordinateur de bureau RTX 5090, GLM-5.2 à 753 milliards sur un seul GPU de station de travail, et un décodage 3 à 4 fois plus rapide avec un préremplissage 6 à 30 fois plus rapide face à Ollama et llama.cpp. La prise en charge couvre les séries RTX 30, 40 et 50 sous Linux et Windows, avec des poids MXFP4, NVFP4, FP8 et BF16.

L'autre direction, c'est la quantification. Unsloth a publié jeudi un GGUF 3 bits de GLM-5.3-Flash, le modèle que Z.ai a révélé cette semaine comme étant l'Ox Alpha resté six jours en tête d'OpenRouter. AI Times situe le fichier à environ 120 Go, soit à peu près 81 pour cent de moins que la version en pleine précision, tournant sur une machine de 128 Go comme un Mac Studio ou une station de travail sans GPU requis, et Unsloth revendique 82 pour cent des performances du modèle BF16 grâce à une quantification sélective par couche avec surveillance de la divergence KL pour garder la distribution de sortie proche. Cette revendication vient du fournisseur, tout comme la ligne de la fiche de Z.ai selon laquelle GLM-5.3-Flash s'approche de Claude Opus 4.8 sur les bancs d'essai de codage et agentiques.

Mettez les deux ensemble et le portrait pratique change. Un modèle multimodal de 320 milliards de paramètres avec des poids MIT, un moteur qui traite un GPU grand public et son processeur hôte comme un seul problème d'ordonnancement, et une quantification qui fait entrer le tout dans la mémoire système : le palier de pointe n'est pas encore local, mais celui juste en dessous tourne maintenant sur un bon ordinateur de bureau. Ce qu'il faut surveiller, c'est si des bancs d'essai indépendants reproduisent les débits annoncés, et combien de qualité le chemin 3 bits coûte vraiment sur du travail réel plutôt que sur la perplexité.