已經發布的模型和多數人手頭的機器之間的差距,就是今年開放權重的全部問題。本週的兩次發布,從相反的方向把這道差距收窄了。
週五發布的 FreeToken,被它的 README 稱為面向邊緣的原生混合專家服務引擎,來自加州大學柏克萊分校和麻省理工的研究者,作者包括 Ion Stoica、Matei Zaharia、Song Han 和 Kurt Keutzer,以 Apache 2.0 發布在 GitHub 上,儲存庫為 FlashML-org/FreeToken,論文見 arXiv 2608.16157。它的思路是調度而非壓縮。靜態專家卸載在所需專家不在顯示記憶體時會讓 GPU 空轉,因此 FreeToken 採用論文所稱的 q star 策略:根據實測 PCIe 吞吐,把每個 token 的計算拆分到 CPU 核心與 GPU 張量核心之間;配合快速權重格式和整層雙緩衝,讓權重串流與計算重疊;再加上一個彈性記憶體管理器,在執行時把顯示記憶體在 KV 快取與專家槽位之間調配。InfoQ 給出了數字:8GB 的 RTX 4060 筆電上 Qwen3.6-35B 約每秒 39 個 token;RTX 5090 桌機上執行 2840 億參數的 DeepSeek-V4-Flash;單張工作站 GPU 上執行 7530 億參數的 GLM-5.2;相對 Ollama 和 llama.cpp,解碼快 3 到 4 倍,預填充快 6 到 30 倍。支援範圍涵蓋 Linux 與 Windows 上的 RTX 30、40、50 系列,權重格式包括 MXFP4、NVFP4、FP8 和 BF16。
另一個方向是量化。Unsloth 於週四發布了 GLM-5.3-Flash 的 3 位元 GGUF,正是 Z.ai 本週揭曉的那個 Ox Alpha,它曾連續六天位居 OpenRouter 榜首。AI Times 稱該檔案約 120GB,比全精度版本小約 81%,可在 Mac Studio 或工作站這類 128GB 記憶體的機器上執行且不需要 GPU;Unsloth 聲稱透過分層選擇性量化並用 KL 散度監控保持輸出分布接近,從而保留了 BF16 模型 82% 的表現。這一說法出自廠商自己,正如 Z.ai 模型卡上那句 GLM-5.3-Flash 在編碼與智慧體基準上接近 Claude Opus 4.8。
把兩者放在一起,實際圖景就變了。一個採用 MIT 授權權重的 3200 億參數多模態模型,一個把消費級 GPU 和它的宿主 CPU 當作同一個調度問題的引擎,再加上一種能把整個模型塞進系統記憶體的量化:前沿那一檔還沒有本地化,但緊挨著它的下一檔,如今已經能在一台不錯的桌機上跑起來。接下來要看的是,獨立測試能否重現這些吞吐數字,以及 3 位元路線在真實工作中,而不是在困惑度上,究竟要付出多少品質代價。
