已经发布的模型和多数人手头的机器之间的差距,就是今年开放权重的全部问题。本周的两次发布,从相反的方向把这道差距收窄了。
周五发布的 FreeToken,被它的 README 称为面向边缘的原生混合专家服务引擎,来自加州大学伯克利分校和麻省理工的研究者,作者包括 Ion Stoica、Matei Zaharia、Song Han 和 Kurt Keutzer,以 Apache 2.0 发布在 GitHub 上,仓库为 FlashML-org/FreeToken,论文见 arXiv 2608.16157。它的思路是调度而非压缩。静态专家卸载在所需专家不在显存时会让 GPU 空转,因此 FreeToken 采用论文所称的 q star 策略:根据实测 PCIe 吞吐,把每个 token 的计算拆分到 CPU 核心与 GPU 张量核心之间;配合快速权重格式和整层双缓冲,让权重流式传输与计算重叠;再加上一个弹性内存管理器,在运行时把显存在 KV 缓存与专家槽位之间调配。InfoQ 给出了数字:8GB 的 RTX 4060 笔记本上 Qwen3.6-35B 约每秒 39 个 token;RTX 5090 台式机上运行 2840 亿参数的 DeepSeek-V4-Flash;单张工作站 GPU 上运行 7530 亿参数的 GLM-5.2;相对 Ollama 和 llama.cpp,解码快 3 到 4 倍,预填充快 6 到 30 倍。支持范围覆盖 Linux 与 Windows 上的 RTX 30、40、50 系列,权重格式包括 MXFP4、NVFP4、FP8 和 BF16。
另一个方向是量化。Unsloth 于周四发布了 GLM-5.3-Flash 的 3 位 GGUF,正是 Z.ai 本周揭晓的那个 Ox Alpha,它曾连续六天位居 OpenRouter 榜首。AI Times 称该文件约 120GB,比全精度版本小约 81%,可在 Mac Studio 或工作站这类 128GB 内存的机器上运行且不需要 GPU;Unsloth 声称通过分层选择性量化并用 KL 散度监控保持输出分布接近,从而保留了 BF16 模型 82% 的表现。这一说法出自厂商自己,正如 Z.ai 模型卡上那句 GLM-5.3-Flash 在编码与智能体基准上接近 Claude Opus 4.8。
把两者放在一起,实际图景就变了。一个采用 MIT 许可权重的 3200 亿参数多模态模型,一个把消费级 GPU 和它的宿主 CPU 当作同一个调度问题的引擎,再加上一种能把整个模型塞进系统内存的量化:前沿那一档还没有本地化,但紧挨着它的下一档,如今已经能在一台不错的台式机上跑起来。接下来要看的是,独立测试能否复现这些吞吐数字,以及 3 位路线在真实工作中,而不是在困惑度上,究竟要付出多少质量代价。
