最重要的数字是 10 万亿:据三位熟悉项目的人士向《金融时报》透露,这是字节跳动目前正在预训练的模型的参数量。如果这一数字能挺过训练,它将是中国有史以来尝试的最大模型,是 Moonshot 的 Kimi K3 的三倍,后者上周以 2.8 万亿参数发布,是目前公开发布的最大中文模型。它也将接近行业对 Anthropic Mythos 5 未经证实的估算,约 8 万亿参数,而 Anthropic 从未公布或确认过这个数字。'据 FT 报道'是本段的承重句,以下所有内容都附属于它。

知情人士给出的细节:该模型处于预训练阶段,这一阶段通常需要三到六个月,由字节跳动的 Seed 团队承担,这是一个 2000 人的部门,创始人张一鸣在内部要求其瞄准长期的世界领先模型能力。一位人士补充说,字节跳动已有一年多不采用蒸馏,即在别家实验室的输出上训练模型的做法,这被解读为对今年春天中美实验室互相指责蒸馏的直接回应。FT 的报道还提到,xAI 正在其 Colossus 2 集群上训练六万亿和十万亿参数的 Grok 变体(据埃隆·马斯克),因此规模竞赛正在两个大洲的至少两个集群上重新开跑。

诚实的解读需要两条保留意见,一条技术性,一条编辑性。技术上:参数决定容量而非性能;数据质量、训练方法和后训练才决定模型能做什么,训练精良的小模型一年五十二周都能胜过粗糙的巨兽。编辑上:字节跳动没有宣布任何事,已知的一切就是三位匿名知情人士加上 FT 的既往记录,记录虽好,但不是公告。让它不止是传言的是趋势的方向:2.8 万亿的 Kimi K3 上周以开放形式交付,如果字节跳动延续其 Seed 模型的惯例,封闭实验室在绝对规模上的领先优势将继续缩小。

对构建者来说,值得观察的是实际问题。模型是否会发布,预训练经常悄无声息地取消;是否会开放发布,这是字节跳动的规模真正触达你的唯一途径;以及能力上是否接近 Mythos 5,如果是,开放权重的天花板将再次移动。关于这则新闻唯一不该做的,恰是所有人都会做的:把'10 万亿'读作能力声明。它是预算声明。