OpenAI 本周發布了數百個聲稱解決了世界上最難數學問題的方案。該前沿實驗室表示,他們曾諮詢了一個由頂尖數學家組成的顧問小組,以避免上次他們的模型解決一個長期懸而未決的數學問題時所引發的爭議。
但 OpenAI 並未達到這些標準,尤其是在數學家強調需要人類理解數學結果的部分。這一點在一篇新論文發表後顯得更加令人擔憂。該論文指出, OpenAI 模型據稱解決的一個價值100萬美元的問題,其自然語言表述與正式表達之間存在差距。
數學與人工智能諮詢組(Advisory Group on Mathematics and Artificial Intelligence,簡稱AGMAI)由普林斯顿大學高等研究院主辦,成員包括來自全球各機構的9位知名研究人員。
該組織在9月底發布了針對前沿實驗室解決數學問題的指導原則。AGMAI在針對最新一批證明的聲明中表示:「最終,是否成功遵循了我们的建議,仍需由數學界來評估。」
不過,該組織的首要要求是「停止在專有模型上測試高級數學問題」。而 OpenAI 的發布明確寫道,其正在使用數學領域的開放研究問題來評估自己的專有模型。
當 TechCrunch 就 OpenAI 最新的證明發布尋求更詳細的評價時,顧問組並未回應。該實驗室顯然遵循了其中的一些原則,包括盡快發布結果,以及提供模型得出結論的方式的信息。但並非全部都做到了:在719篇手稿中,只有10篇附帶了模型思維鏈的披露。
對於人們看不懂的論文,數學家建議應將證明形式化;但 OpenAI 公布的證明中,有42%尚未經過這一過程。
總體而言,OpenAI 在發布證明時是否依照 AGMAI 的原則「承擔確保人類能夠理解的責任」,目前仍不清晰。AGMAI 建議,OpenAI 应該幫助資助人類數學家的工作,因為這些數學家將需要讓實驗室的解法在任何實際意義上變得有意义。
「問題正被那些對整個領域本身毫無興趣的 AI 提示詞操作者自主解決;一旦他們最初的目標被‘解決’,他們就不再關心了,而且他們對 AI 輸出的理解也不足以回答問題、做報告,或以其他方式與領域中的其他人互動,」知名數學家 Terence Tao 在發布後於社交媒體上寫道。 Tao 此前曾批評過 OpenAI 的做法。
這一問題在這週發表的一篇論文中得到了體現。該論文由劍橋大學和倫敦國王學院的數學家撰寫,質疑前沿實驗室處理這類挑戰的方式。
當 AI 模型解決數學問題時,它們首先會生成一段「自然語言」解釋,然後再試圖將結果寫入 Lean。這是一種編程語言,理論上可以透過將證明編譯為代碼來確認其準確性。
不過,模型將自然語言證明翻譯成代碼的方式可能存在問題;這篇論文記錄了OpenAI一個源自納維-斯托克斯方程的問題所提供的解法中,自然語言證明與Lean代碼之間至少有兩處不一致。納維-斯托克斯方程用於描述流體的複雜行為。
這些不一致並不一定是否定任一版本的解法,但它们確實引發了疑問:我們是否可以在沒有人類參與的情況下,僅依靠模型自身來形式化其解答。這也是 AGMAI 要求 OpenAI 「加入可機器閱讀的元數據,以對應自然語言和形式化產物」的原因之一,但該前沿實驗室在這些發布中並未這樣做。
「由於存在誤譯現象——正如這篇論文所強調的——OpenAI以及其他自動形式化的Lean證明,在沒有經過與其他證明相同的同行評審流程和審查之前,原則上不應該被信任,」這篇論文《迷失在翻譯中》的作者總結道。
數學家強調,當人類發現新的結果時,他們會對這些結果負責,并通過論文、演講和研討會與更廣泛的社群互動。這個過程會加深對解法的理解,找到可用於解決其他問題的策略,並使新知識能夠應用於實際領域。
哈佛大學數學教授 Melanie Wood 告訴 TechCrunch,當模型被提示去解決一個難題並吐出一個解答時,“在發布時並不存在人類的理解,而現在的工作才剛剛開始”。












