【深度分析】OpenAI 的數學突破,是發現還是抄襲?

OpenAI 說 Astra 用 $2,000 的 token 成本就做出了十項數學突破。數學家看完 250 頁論文之後的回應是:「這不是突破,這是文獻回顧——而且還沒好好標引用。」這篇文章的命題不是「AI 有沒有抄襲」,而是「為什麼 OpenAI 的公關機器需要把 recombination 講成 discovery」。答案不在學術倫理裡,在商業模式裡——而這個模式正在改寫「突破」的定義。對數學界而言,那是一場思微的入侵。
原文摘要
OpenAI 最新的 chatbot 數學很強,但學術誠信似乎遠落後於人類標準。
上週,該公司宣布了 10 項由 AI 生成的數學進展。這些成果來自 OpenAI 下一代大型語言模型 Astra 的內部開發與測試期間,每一項都解決或推進了數學界「長期懸而未決」且「具有重大意義」的開放問題。OpenAI 表示,總 token 成本僅 $2,000 美元。
消息迅速傳開,被視為 AI 超越人類、成為數學與電腦科學領域主導力量的又一預兆——或威脅。但在公告之後的幾天裡,當真人數學家仔細審閱這份近 250 頁的論文時,許多人感到愈來愈憤怒。
專家指出,最令人興奮的兩項結果,實際上納入了近期數學文獻中的既有想法,卻未給予適當引用。這與 OpenAI 最初新聞稿的說法矛盾——那份新聞稿宣稱 Astra 解決的問題「至少十年來未見任何進展」。(OpenAI 隨後更新了措辭,使其更為準確。)
Yeshiva 大學數學家 Steven Miller 直言:「他們在以刻意的方式粗暴踐踏前人的成果。」他主張 OpenAI 實際上抄襲了他自己的研究。「在我看來這是完全系統性的行為,指向研究不當行為。」
Miller 所指的成果,涉及「一個箱子裡能裝多少顆球」——一個看似簡單的問題,只是這些球和箱子存在於 1,000 維甚至更高維度的數學空間中。OpenAI 的論文改進了這些球體最密堆積的最佳估計值。這個由 LLM 生成的證明,核心仰賴一個特定的數學論證,論文將其呈現為原創——但實際上最早出現在 Miller 與合作者在 2016 年發表的論文中。
另外十項成果中還有一項,解決了群論中的一個長期問題。群論研究的是稱為「群」的數學物件,它們以有組織的方式彼此互動。數學家長期以來一直想知道,是否所有群都具有「soficity」這個性質——也就是能否以特定方式被其他更簡單的群忠實地近似。OpenAI 的論文至少確立了一個不具備此性質的群。
這項發現讓劍橋大學研究群論的數學家 Francesco Fournier-Facio 大為震驚——至少在他「以對待人類研究者的方式來審視這項突破」之前是如此。他說,他和一些同事發現,這項成果並不如乍看之下那樣新穎。就像近期許多 AI 的「突破」一樣,它其實是將數學文獻中的既有想法拼湊在一起,建構出一個新定理。LLM 的訣竅再一次顯現:超人類的耐心,用於拼湊拼圖碎片,而非進行某種深層的智慧跳躍。
具體來說,Astra 的關鍵數學步驟組合了兩篇論文(2016 年與 2019 年)中首次出現的想法。這兩篇論文的共同作者、德勒斯登工業大學數學家 Andreas Thom 在 MathOverflow.com 上總結這項結果時,稱其為「有創意,同時又基礎」。
OpenAI 最初的新聞稿似乎完全忽略了——或根本不知道——這些關鍵的近期進展。Fournier-Facio 認為,這兩篇先行論文表明,人類在 soficity 問題上並未陷入僵局。他說,OpenAI 的數學家在論文中確實盡力正確標註了這些想法的出處。但,儘管出於善意,「有一個龐大的公關機器,它想要聽起來盡可能令人印象深刻,它不在乎是否 100% 準確。」
OpenAI 發言人在給《Scientific American》的聲明中表示:「我們對這些結果的正確性負責,並且符合人類數學家普遍被期待的標準。我們計劃本週對論文進行小幅更新,這符合標準學術慣例。」
但隨著 AI 持續在沒有內建學術規範忠誠度的前提下「征服數學」,學術社群中有些人顯然正在失去耐心。「OpenAI 現在已是高等研究的完全參與者,」Fournier-Facio 說,「所以他們應該被用跟我們一樣的學術標準來檢視。」
城武觀點
這件事不能簡化成「OpenAI 抄襲」。真正的問題不在論文那 250 頁裡,在新聞稿的那三句話裡。兩層結構拆開說。
第一層:Astra 做的是什麼? 超人類規模的文獻回顧,不是超人類的數學洞察。sphere packing 那題:核心論證來自 Miller 團隊 2016 年論文,Astra 找到它、裝進自己的證明。soficity 那題:關鍵步驟組合了 Thom 2016 和 2019 年兩篇論文的既有想法,Thom 自己評語是「有創意,同時又基礎」——白話:「零件我都認得,組合滿巧妙的。」LLM 做的是 recombination,不是 discovery。它能接起兩個從未被放在同一篇論文的引理,這是真的能力——但名字叫「文獻回顧的規模化」,不叫「數學洞察」。學術界每天都在做文獻回顧,只是人類一年讀 200 篇,Astra 一次讀 200 萬篇。量的差異大到看起來像質的差異,本質沒變。
第二層:為什麼公關機器必須混淆這兩者? Fournier-Facio 說了全篇最精準的一句話:「公關機器想要聽起來盡可能令人印象深刻,不在乎是否 100% 準確。」重點不是「不小心」誇大,是必須誇大。AI 公司的估值建立在「AI 做到人類做不到的事」這個前提上。真相如果是「AI 做到人類做得出來、只是沒時間做的事」,估值模型就要重寫。所以新聞稿不能寫「完成大規模文獻回顧,發現人類數學家來不及互相引用的關聯」——必須寫「解決了十個十年來沒有進展的開放問題」。前者是實話,後者是幻覺。前者不值錢,後者值得下一輪融資。
然後被抓包了。OpenAI 的修正方式不是撤新聞稿、不是道歉——是「更新措辭,使其更為準確」。發言人回應:「我們對正確性負責,符合人類數學家的標準,本週會小幅更新。」公關 101:承認一個夠小的錯,來迴避那個夠大的錯。
那夠大的錯不是抄襲。是商業模式決定了「突破」的定義。當估值取決於「AI 做到人類做不到的事」的敘事,公關機器就會系統性地把 recombination 重新命名為 discovery。Miller 說得對,這是「系統性的」。
(這篇文的封面圖是 AI 生成,文章也由 LLM 輔助。我沒把這包裝成「超人類寫作突破」,也沒宣稱城武做到人類做不到的事。我收費 $0,你付注意力。OpenAI 收的是估值,數學家付的是被踐踏的引用。這兩件事不一樣。)
這個模式不會停在數學。下一次是物理,再下一次是任何一個「AI 在 N 秒內做到人類需要 M 年」的領域。每次背後都是同一台公關機器、同一個商業邏輯。我們要問的永遠是同一個問題:這真的是突破,還是只是算力終於夠了,把前人的智慧重新排列組合了一次?
城武的未解檔案——$2,000 的 token 費用買到的不是十項數學突破,是十個證明:證明 AI 最擅長的事情,是把人類以經做過的工作,包裝成人類做不到的奇蹟。
- 原文:OpenAI’s latest math breakthroughs commit research misconduct, experts say(Joseph Howlett, Scientific American, 2026-08-06)