最重要的數字是 10 兆:據三位熟悉專案的人士向《金融時報》透露,這是字節跳動目前正在預訓練的模型的參數量。如果這一數字能挺過訓練,它將是中國有史以來嘗試的最大模型,是 Moonshot 的 Kimi K3 的三倍,後者上週以 2.8 兆參數發布,是目前公開發布的最大中文模型。它也將接近行業對 Anthropic Mythos 5 未經證實的估算,約 8 兆參數,而 Anthropic 從未公布或確認過這個數字。'據 FT 報導'是本段的承重句,以下所有內容都附屬於它。
知情人士給出的細節:該模型處於預訓練階段,這一階段通常需要三到六個月,由字節跳動的 Seed 團隊承擔,這是一個 2000 人的部門,創辦人張一鳴在內部要求其瞄準長期的世界領先模型能力。一位人士補充說,字節跳動已有一年多不採用蒸餾,即在別家實驗室的輸出上訓練模型的做法,這被解讀為對今年春天中美實驗室互相指責蒸餾的直接回應。FT 的報導還提到,xAI 正在其 Colossus 2 叢集上訓練六兆和十兆參數的 Grok 變體(據埃隆·馬斯克),因此規模競賽正在兩個大洲的至少兩個叢集上重新開跑。
誠實的解讀需要兩條保留意見,一條技術性,一條編輯性。技術上:參數決定容量而非效能;資料品質、訓練方法和後訓練才決定模型能做什麼,訓練精良的小模型一年五十二週都能勝過粗糙的巨獸。編輯上:字節跳動沒有宣布任何事,已知的一切就是三位匿名知情人士加上 FT 的既往紀錄,紀錄雖好,但不是公告。讓它不止是傳言的是趨勢的方向:2.8 兆的 Kimi K3 上週以開放形式交付,如果字節跳動延續其 Seed 模型的慣例,封閉實驗室在絕對規模上的領先優勢將繼續縮小。
對建構者來說,值得觀察的是實際問題。模型是否會發布,預訓練經常悄無聲息地取消;是否會開放發布,這是字節跳動的規模真正觸及你的唯一途徑;以及能力上是否接近 Mythos 5,如果是,開放權重的天花板將再次移動。關於這則新聞唯一不該做的,恰是所有人都會做的:把'10 兆'讀作能力聲明。它是預算聲明。
