最重要的數字是 2840 億:DeepSeek V4 Flash 混合專家骨幹中的參數量,其中任何單個提示只啟動約 130 億。這個骨幹正是 V4 Flash Vision Exp 的基礎,DeepSeek 週五在其付費開發者平台上推出的多模態智慧體模型。"Exp" 後綴很誠實:公司沒有為新模型公布任何架構說明,其慣例的開放權重發布也未獲確認,對一家發布通常以 checkpoint 打頭的實驗室來說是顯著的反轉。
廠商的基準表很具體。對比自家前身,Vision Exp 在七項文字基準中贏下六項,唯一的敗績在 Cybergym,該套件衡量軟體漏洞發現能力。提升集中在名字所指之處:四項視覺基準中,該模型在其中兩項上比 V4 Flash 提高超過 10%;據 SiliconANGLE 報導,它在 ALE 上還擊敗了 Anthropic 的 Opus 4.8,ALE 包含 1000 多個多步任務,要求與應用互動、編寫程式碼並解讀媒體內容;ZeroBench 則是 100 道專為前沿模型設計的高難度圖像分析題。這些都還沒有經過獨立評估,在第三方跑分出現之前,請把這些圖表當作廠商主張來看待。
底層是 4 月 V4 Flash 模型卡記錄過的工程:HCA 與 CSA 兩種 KV 快取壓縮技術,把百萬 token 提示所需的算力削減約四分之三;在 32 兆 token 上訓練;並用 Muon 優化器加速隱藏層校準。DeepSeek 更大的 V4 Pro 參數量是其五倍多,如果 Vision Exp 的路子成立,它顯然是接受同樣視覺改造的下一個候選。
對開發者來說,故事的主線是 computer-use 智慧體的性價比走向。來自 DeepSeek 這種成本結構的讀屏智慧體模型,衝擊了「嚴肅的視覺智慧體工作必須掏旗艦預算」的假設;Canaltech 的報導描述的正是這個用例:看著螢幕完成任務。值得盯住兩件事:獨立基準能否證實與 Opus 4.8 的對比,以及權重是否會跟進,因為一個可下載的、啟動參數 130 億的讀屏模型,將在 Muse Glimmer 和 Qwen 3.8 之後僅兩週,再次撬動本地智慧體檔位。
