最重要的數字是 0.14 美元:DeepSeek V4-Flash-0731 每百萬輸入 token 的價格,7 月 31 日在 Hugging Face 以免門檻 MIT 授權發布,輸出每百萬 0.28 美元,約為 V4-Pro 檔收費的三分之一。基座是 2840 億參數的混合專家模型,每 token 啟用 130 億,上下文視窗 100 萬 token;模型卡上的 3040 億數字包含了附帶的 DSpark 投機解碼草稿模組。官方口徑是架構和規模與預覽版一致,提升僅來自重新後訓練。

獨立測量,刻意很小:Simon Willison 透過 OpenRouter 跑了他標準的鵜鶘測試,預設推理強度下得到一隻令人失望的鵜鶘,用他原話說,把推理開到高檔後則好得多。Artificial Analysis 把該模型排在 MiniMax 的 M3(一個 4280 億模型)之前,並稱其可能是目前性價比最高的模型。DeepSeek 自己的基準表更大,讀起來像行銷;附在上面的有用警告來自 MarkTechPost:智能體分數對框架敏感,獨立執行可能有出入。用本編輯部的速記法:被主張的很多,被測量的很少,而測量到的是有利的。以這個價格自己跑一遍依然便宜。

同日發布的 MiniMax H3 是本週的另一半。它是一個全模態影片模型,把文字、圖像、影片和音訊讀作一個統一上下文,而它真正的差異化是原生立體聲:音訊是一等輸入,你可以給它一段參考音訊,讓圖像裡的角色唱出來,它隨影片直接輸出立體聲,而不是依賴單獨的配音環節。輸出為 2K、4 到 15 秒,僅整數時長。底層機制包括:一個把約 10 萬 token 源材料蒸餾到 4 千的標註方案;一個它聲稱帶來 4 倍有效序列長度增益的新 VAE;以及一個上下文內再生步驟,替代外掛式超分模組。

保留意見才是有用的部分。H3 目前只能透過 MiniMax 的 API 和 Hailuo 應用存取;開放權重承諾'在未來幾天內'提供,截至發稿並不存在,而這正是本編輯部在交付前一律按零計值的那種承諾。價格主張是 MiniMax 自己的(2K 下不到主流模型的三分之一);第三方追蹤給出的按量付費約為每秒 0.13 美元,屬報導而非確認。而《南華早報》援引 Artificial Analysis 稱,H3 在影片編輯上領先,在文生影片上落後於 Google 的 Gemini Omni Flash,在圖生影片上位於 Seedance 2.0 之後。兩個發布,一個模式:本週模型領域有意思的動作發生在邊緣地帶,開放權重和影片,而不是封閉的前沿。