Anthropic 自己不預期 Claude 使用的技術證明黎曼猜想。黎曼猜想認為,黎曼 zeta 函數的每個非平凡零點都位於實部為二分之一的臨界線上,這個猜想仍未獲得證明。Anthropic 較窄的主張依然重大。Claude 的一個未發布研究版本給出了無條件證明,把位於該線上的零點占比已知下界從 41.6% 提高到 67.2%。這是對漸近占比的下界,不是所有零點都在該線上的證明,也沒有說明其餘零點在哪裡。
新聞價值在於躍升幅度。Anthropic 的論文稱,41.6% 的紀錄自 2020 年保持至今。按照公告中的四捨五入數字,Claude 在一項結果中把紀錄提高了 25.6 個百分點。論文列出的歷史進展中,沒有任何一次改進接近這個幅度。證明大量借鑑了 Baluyot、Goldston、Suriajaya 和 Turnage-Butterbaugh 的成對關聯研究,也使用了 Bombieri 的早期工作。新步驟是用線性代數重新解讀這套方法,透過一個二次型同時處理臨界線上和線外的零點。結果延伸了人類數學,而不是脫離人類數學憑空出現。
這套驗證比聽起來可信的模型紀錄更強。Anthropic 發布了基於 Mathlib zeta 函數定義的 Lean 4 形式化證明,並稱它通過標準 comparator,沒有未完成證明占位符。Anthropic 數學家 Levent Alpöge 和 Ralph Furman 研究並驗證了結果。Brian Conrey 和 Dan Goldston 在很短時間內從外部審閱了論文。Conrey 自己的工作就在臨界線下界的經典歷史中,因此他的審閱具有分量。但界限仍需說明:發布模型、論文和驗證說明的都是 Anthropic。外部審閱不等於獨立的同儕審查出版。
人類提供的火花異常小而具體。Bun 的建立者、非數學家 Jarred Sumner 要求 Claude 認真嘗試黎曼猜想。Anthropic 稱,模型最初嘗試了 650 個想法但都失敗,隨後用一天半協調大約 60 個子代理。在 31 million 個輸出 token 中,它們執行了 2,400 條 shell 命令,檢查候選論證並互相審閱工作。Sumner 的輸入主要是鼓勵訊息。隨後 Claude 搜尋反例,下載 54 篇論文檢查新穎性,並獨立重新證明該結果。這些數字描述的是一次昂貴的研究執行,不是可重複的 benchmark。
真正有後果的部分不是勵志軼事,也不是模型品牌,而是一個推動百年下界的具體定理。它帶有機器可檢查的成品,也附有製造者明確寫出的限制。研究模型尚未發布,因此外部研究者還不能測試這種能力能否泛化。披露材料只有 Anthropic 這一個來源,因此更廣泛的數學界仍需仔細檢查證明及其新穎性。如果結果經受住這一過程,它就應進入數論紀錄。這不會讓黎曼猜想減少半分未解狀態。
