本文來(lái)自微信公眾號(hào): 果殼 ,作者:Luna
2026年,數(shù)學(xué)遭遇密集"AI攻城"。
7月20日,Anthoropic的一名員工Levent Alp?ge在X.com上說(shuō),自己在看世界杯時(shí),順手用Fable 5找出了雅可比猜想的一個(gè)反例,在X上引起軒然大波,因?yàn)檫@是數(shù)學(xué)界的頂級(jí)“懸案”之一,人們用了87年試圖證明它的正確性;華人數(shù)學(xué)家張益唐當(dāng)年的博士論文題目正是與此有關(guān),而論文的不順又導(dǎo)致他后來(lái)多年以打雜為生。
Anthoropic這個(gè)非正式的數(shù)學(xué)高光時(shí)刻,已經(jīng)比對(duì)手晚得多。再往前推兩個(gè)月,OpenAI和谷歌幾乎是當(dāng)面對(duì)決。
5月20日,OpenAI宣布:其內(nèi)部一個(gè)通用推理模型,自主推翻了匈牙利傳奇數(shù)學(xué)家保羅·埃爾德什(Paul Erd?s)提出的"單位距離猜想"。這個(gè)問(wèn)題已困擾了數(shù)學(xué)家整整80年。菲爾茲獎(jiǎng)得主蒂莫西·高爾斯(Timothy Gowers)直言不諱地評(píng)價(jià):“此前沒(méi)有任何AI生成的證明能接近這個(gè)水準(zhǔn)?!?/p>
僅僅一天后,Google的DeepMind以更大的規(guī)模還擊。
他們?cè)O(shè)計(jì)的數(shù)學(xué)模型AlphaProof Nexus,自主解決了9道公開(kāi)的Erd?s難題,其中2道已經(jīng)懸而未決長(zhǎng)達(dá)56年。此外,它還解決了另外一些問(wèn)題,每個(gè)問(wèn)題的推理成本也低到僅為幾百美元。

DeepMind高管Pushmeet Kohli宣布AlphaProof Nexus解決了數(shù)個(gè)問(wèn)題丨X.com
三家公司的成果,在數(shù)學(xué)界和大眾輿論中都引起了轟動(dòng)。
能力飛躍
要理解今年數(shù)學(xué)界的震撼程度,可以回看這條清晰的加速曲線。
2024年7月,DeepMind的AlphaProof在國(guó)際數(shù)學(xué)奧林匹克競(jìng)賽(IMO)中解出6道題中的3道非幾何題,達(dá)到銀牌水平。這是AI首次在IMO中獲得獎(jiǎng)牌級(jí)表現(xiàn)。注意,此時(shí)它解出的問(wèn)題都有答案,不是未知、開(kāi)放性的。
2025年10月,OpenAI曾聲稱(chēng)GPT-5解決了10道Erd?s難題,但這一說(shuō)法在幾小時(shí)內(nèi)就被公開(kāi)駁斥:GPT-5并非原創(chuàng)求解,而是做了"超級(jí)文獻(xiàn)檢索",找到了此前罕為人知的已發(fā)表論文。
2025年年末,DeepMind部署了智能體Aletheia。在Erd?s問(wèn)題數(shù)據(jù)庫(kù)中,Aletheia挑選了700道進(jìn)行嘗試;它正確解決了13個(gè)問(wèn)題,其中4道是新解答,另外9道又是“超級(jí)文獻(xiàn)檢索”成功了。
而2026年5月至今的這三次突破,有了本質(zhì)性不同:
第一,問(wèn)題份量重。Aletheia的研究者自己就承認(rèn),去年所解決的4道Erd?s難題,大多冷門(mén),有些可能從來(lái)沒(méi)有專(zhuān)家認(rèn)真嘗試過(guò)。但此次OpenAI所推翻的“單位距離猜想”,核心、知名,哪怕有Erd?s本人為它懸賞卻仍長(zhǎng)期懸而未決,難度和地位都得到公認(rèn)。
Anthoropic Fable 5找出反例的雅可比猜想,被美國(guó)數(shù)學(xué)家、菲爾茲獎(jiǎng)得主斯蒂芬·斯梅爾(Steve Smale)列入“18個(gè)21世紀(jì)的世紀(jì)數(shù)學(xué)難題”。雖然這次AI只是找到了三維空間中的一個(gè)反例、二維中猜想是否為真尚不得而知,但仍因問(wèn)題難度大,而被數(shù)位數(shù)學(xué)家認(rèn)為是AI的重要突破。
第二,更自主。之前AI解決數(shù)學(xué)問(wèn)題是"半自主"的:AI生成候選方案,然后需要數(shù)學(xué)家人工篩選、修正細(xì)微錯(cuò)誤。而OpenAI 5月的突破,是模型完全自主地生成了整個(gè)證明。更進(jìn)一步地,谷歌的AlphaProof Nexus不再需要數(shù)學(xué)家給它做質(zhì)檢了。它利用了一種叫Lean的形式語(yǔ)言,自主完成了正確性檢驗(yàn)。
Fable 5的工作細(xì)節(jié),現(xiàn)在我們還不得而知。
轟動(dòng)新聞,離不開(kāi)精心“設(shè)計(jì)”
OpenAI所解決的那個(gè)問(wèn)題是這樣的:在一個(gè)平面上放n個(gè)點(diǎn),那么距離恰好是1的點(diǎn),最多能有多少對(duì)?數(shù)學(xué)家Erd?s在1946年猜測(cè),正方形網(wǎng)格的排列方式是最優(yōu)解。
不管你會(huì)不會(huì)解這道問(wèn)題,但我相信,你很容易看懂它。這也正是OpenAI新聞成功引發(fā)轟動(dòng)的關(guān)鍵點(diǎn)之一。

“OpenAI的數(shù)學(xué)團(tuán)隊(duì)里,有很了解數(shù)學(xué)研究的專(zhuān)業(yè)人士。這個(gè)團(tuán)隊(duì)顯然是花了大量的時(shí)間,從那些尚未被解答的數(shù)學(xué)問(wèn)題中,挑選哪個(gè)可能做得出來(lái)。從被挑選過(guò)的問(wèn)題中,又著重精選幾個(gè)最有可能出成果的、簡(jiǎn)單到大眾也能聽(tīng)懂、數(shù)學(xué)家又要足夠關(guān)注的問(wèn)題”,北京大學(xué)國(guó)際數(shù)學(xué)中心副教授李欣意這樣分析。
“甚至他們要考慮到,證明也不能冗長(zhǎng),不能讓數(shù)學(xué)家用上半年才能復(fù)核完畢?!?/p>
Anthoropic Fable 5所提出的雅可比猜想反例,更是簡(jiǎn)潔到只有寥寥幾行式子,很容易就被其他數(shù)學(xué)研究者驗(yàn)證。

Levent最初的那條推文丨x.com
是的,研究者們必須把“人類(lèi)友好”考慮進(jìn)去。
AI現(xiàn)在還不能拋開(kāi)人類(lèi)
當(dāng)AI使用大語(yǔ)言模型寫(xiě)出一些“看起來(lái)很有道理”的推理的時(shí)候,它到底有沒(méi)有犯錯(cuò),是很難由它自己來(lái)確證的。
OpenAI使用的是一個(gè)通用推理模型。它接收到問(wèn)題后,用自然語(yǔ)言(即人類(lèi)能讀懂的語(yǔ)言)生成了一條非常長(zhǎng)的思維鏈,每個(gè)子Agent做一部分短小的自然語(yǔ)言論證、一環(huán)套一環(huán),最后得出一個(gè)結(jié)果。
但自然語(yǔ)言推理有一個(gè)天然的弱點(diǎn):模型可能在推理鏈的某一步犯小錯(cuò),最終釀成大錯(cuò)。所以O(shè)penAI請(qǐng)來(lái)了9位頂級(jí)數(shù)學(xué)家對(duì)證明進(jìn)行人工審查。這些數(shù)學(xué)家不僅驗(yàn)證了正確性,還大幅改進(jìn)了原始證明,使之更簡(jiǎn)潔、更通用。Erd?s問(wèn)題數(shù)據(jù)庫(kù)的維護(hù)者托馬斯·布魯姆評(píng)論道:"人類(lèi)在討論、消化、改進(jìn)這個(gè)證明以及探索其后果方面,仍然扮演著關(guān)鍵角色。"
DeepMind的AlphaProof Nexus在推理過(guò)程中,靠Lean語(yǔ)言暫時(shí)擺脫了“人”證明它對(duì)不對(duì);人類(lèi)只最后確認(rèn)結(jié)果的數(shù)學(xué)意義。
·大語(yǔ)言模型會(huì)用Lean的形式化語(yǔ)言生成證明步驟;
·Lean編譯器檢查每一步是否成立;如果某一步不通過(guò),Lean返回錯(cuò)誤信息,模型據(jù)此修正;
·循環(huán)往復(fù),直到成功。
全部用Lean去驗(yàn)證這件事情,看起來(lái)很美妙,但還遠(yuǎn)遠(yuǎn)沒(méi)有到完全能夠?qū)嵅俚某潭取:?jiǎn)單說(shuō)就是:Lean語(yǔ)言嚴(yán)格而冗長(zhǎng),人類(lèi)很難直接寫(xiě)或讀懂,需要“翻譯”,但“翻譯現(xiàn)有數(shù)學(xué)定理”這一基礎(chǔ)建設(shè),也還差得很遠(yuǎn)。
AI的數(shù)學(xué)能力高于人類(lèi)嗎?
先說(shuō)結(jié)論:AI目前并不比人類(lèi)更聰明。它只是沒(méi)有學(xué)科壁壘、沒(méi)有權(quán)威偏見(jiàn),然后“大力出奇跡”。
AI證明了Erd?s是錯(cuò)的、雅可比猜想有反例,而不是像大多數(shù)人那樣,面對(duì)傳奇數(shù)學(xué)家的一個(gè)古早猜想,沿著心理慣性,試圖證明他是對(duì)的。它又比那些試圖尋找反例的人,更有耐心反復(fù)嘗試。
AI是個(gè)“通才”,這同樣令人類(lèi)自嘆弗如。5月份OpenAI解決的單位距離問(wèn)題屬于幾何領(lǐng)域,成功的關(guān)鍵是,它從代數(shù)領(lǐng)域的數(shù)論中引入了一個(gè)看似無(wú)關(guān)的工具。要知道,現(xiàn)代數(shù)學(xué)高度分工,研究組合幾何的數(shù)學(xué)家通常不會(huì)深入探究數(shù)論,反之亦然。這兩個(gè)領(lǐng)域之間的距離,就像讓一個(gè)心臟外科醫(yī)生去想到用免疫學(xué)的方法治病。
不過(guò),AI現(xiàn)在缺乏在新方向上的洞察和探索能力。李欣意做了一個(gè)這樣的比喻:
“如果人類(lèi)的數(shù)學(xué)知識(shí)可以比喻成一個(gè)有凹有凸的多邊形,外部是未知部分,那么一流的數(shù)學(xué)家可能在一個(gè)尖角上把邊界拓展到遠(yuǎn)處;像希爾伯特這樣的偉大數(shù)學(xué)家,甚至在好幾個(gè)方向都走得很遠(yuǎn);而廣大的數(shù)學(xué)工作者大多數(shù)時(shí)候做的事情,是把凹進(jìn)去的部分補(bǔ)齊——數(shù)學(xué)上叫做‘取凸包’。
“現(xiàn)階段‘大新聞’里的的數(shù)學(xué)AI,也不過(guò)是把知識(shí)變成知識(shí)的凸包,而不是在未知方向上探索得更遠(yuǎn)。”

黃色的部分,是AI的“補(bǔ)齊”短板
假如有朝一日,AI掌握了往外走的能力,那可能確實(shí)就真的是全面超越了人類(lèi)。
數(shù)學(xué)家預(yù)見(jiàn)到重重危機(jī)
2026年6月2日,來(lái)自15所大學(xué)的16位研究者發(fā)布了《萊頓人工智能與數(shù)學(xué)宣言》。這份宣言獲得了國(guó)際數(shù)學(xué)聯(lián)盟(IMU)的正式支持,陶哲軒、彼得·舒爾茨等知名數(shù)學(xué)家也公開(kāi)簽署。
宣言并不反對(duì)使用AI,也鼓勵(lì)數(shù)學(xué)家了解新興技術(shù)。它擔(dān)心的是,在用AI更快、更多地生成成果的過(guò)程中,數(shù)學(xué)界一些基本價(jià)值觀可能被破壞。
最直接的問(wèn)題是,AI能夠快速生成大量“看起來(lái)正確”的證明,其中卻可能藏著很難發(fā)現(xiàn)的錯(cuò)誤。AI“完成”一個(gè)證明只需要幾小時(shí);認(rèn)真審查它,卻要花幾周甚至更長(zhǎng)。有能力審稿的數(shù)學(xué)家極其有限,AI成果井噴會(huì)導(dǎo)致同行評(píng)議體系“消化不良”;如果大量的AI推理直接以預(yù)印本甚至新聞稿的形式發(fā)表,則是嚴(yán)重的誤導(dǎo),并擠占了那些真正有價(jià)值的發(fā)現(xiàn)的空間。
這個(gè)擔(dān)憂甚至馬上被驗(yàn)證了。就在幾天以前,OpenAI在發(fā)布GPT 5.6 Sol的關(guān)頭,發(fā)布新聞稿,宣布解決了一個(gè)塵封50年的數(shù)學(xué)問(wèn)題。但這個(gè)成果并沒(méi)有得到外部數(shù)學(xué)專(zhuān)家的確認(rèn)。

OpenAI也沒(méi)有說(shuō)明,在“智能體解答問(wèn)題”和“最終產(chǎn)出3頁(yè)結(jié)果”之間,還有多少人類(lèi)勞動(dòng)丨OpenAI
另一個(gè)問(wèn)題是成果歸屬。數(shù)學(xué)AI建立在大量的前人研究成果之上,但在輸出時(shí),往往無(wú)法為貢獻(xiàn)者合理署名,這對(duì)數(shù)學(xué)家不公平。部分訓(xùn)練數(shù)據(jù)還涉及未經(jīng)許可使用論文和數(shù)據(jù)庫(kù),由此產(chǎn)生新的版權(quán)爭(zhēng)議。以及,如果數(shù)學(xué)家協(xié)同AI產(chǎn)生新的數(shù)學(xué),那么這一成果究竟是屬于人類(lèi)還是AI?
《宣言》還提出了一個(gè)更隱蔽的威脅:科技公司可能開(kāi)始影響數(shù)學(xué)界的導(dǎo)向。AI公司傾向于搞那些“容易做”的問(wèn)題,而非“有深遠(yuǎn)意義”。在大學(xué)預(yù)算緊張的背景下,這可能改變激勵(lì)機(jī)制,變相鼓勵(lì)研究人員與科技公司進(jìn)行不對(duì)等的合作。如果不加以控制,可能破壞現(xiàn)有的招聘、資助和認(rèn)可機(jī)制,威脅研究人員的自主性,甚至影響數(shù)學(xué)研究本身的范圍和深度。
數(shù)學(xué)的價(jià)值不只是得到更多答案。它還包括理解答案為何成立,判斷哪些問(wèn)題重要,以及從舊知識(shí)中發(fā)現(xiàn)新的研究方向。這些能力由數(shù)學(xué)共同體經(jīng)過(guò)長(zhǎng)期討論、爭(zhēng)論和傳承形成,很難用“解出了多少道題”來(lái)衡量。
因此,《萊頓人工智能與數(shù)學(xué)宣言》要求研究者公開(kāi)AI和計(jì)算資源的使用情況,堅(jiān)持同行評(píng)審,由人類(lèi)作者承擔(dān)正確性和引用責(zé)任,并建設(shè)獨(dú)立于商業(yè)公司的公共計(jì)算設(shè)施。
數(shù)學(xué)家想守住的,并不只是自己的工作。他們還想守住決定“什么數(shù)學(xué)值得做”的權(quán)利。
感謝北京大學(xué)國(guó)際數(shù)學(xué)中心李欣意副教授對(duì)本文的支持
參考文獻(xiàn)
1.[1]Anthony Ha.OpenAI’s‘embarrassing’math.TechCrunch,2025年10月19日。https://techcrunch.com/2025/10/19/openais-embarrassing-math/
2.[2]Matthias Bastian.Leading OpenAI researcher announced a GPT-5 math breakthrough that never happened.The Decoder,2025年10月18日。https://the-decoder.com/leading-openai-researcher-announced-a-gpt-5-math-breakthrough-that-never-happened/
3.[3]Tony Feng等.Semi-Autonomous Mathematics Discovery with Gemini:A Case Study on the Erd?s Problems.arXiv:2601.22401v2。https://arxiv.org/html/2601.22401v2
4.[4]Tony Feng等.Towards Autonomous Mathematics Research.arXiv:2602.10177v3。https://arxiv.org/html/2602.10177v3
5.[5]Rubin Pillay.The Aletheia Moment:Why Dismissing AI Reveals Fundamental Misunderstanding.Substack,2026年2月17日。https://rubinpillay.substack.com/p/the-aletheia-moment-why-dismissing
6.[6]Noga Alon、Thomas F.Bloom、W.T.Gowers等.Remarks on the disproof of the unit distance conjecture.arXiv:2605.20695v1。https://arxiv.org/html/2605.20695v1
文內(nèi)未注明來(lái)源的圖片為AI生成
