研究測試AI獨立做科學研究:能跑實驗,難產原創成果
Decrypt
Ai 焦點
最新研究顯示,前沿 AI 智能體可完成多項科學研究工程任務,但尚無法穩定產出可被頂級 AI 會議接收的原創論文。
有幫助
No.幫助

由普林斯頓大學、英國 AI 安全研究所、史丹佛大學和多倫多大學等機構參與的研究顯示,當前前沿 AI 智能體已能獨立完成不少科研流程中的工程工作,但在提出原創科學貢獻方面仍明顯不足,尚難產出可被頂級機器學習會議接收的論文。

六天內完成整套流程

研究發表於週三,題為《AI 智能體能否進行開放式 AI 研究? 》。研究團隊沒有採用預設答案的標準測試,而是把兩篇尚未公開的 NeurIPS 2026 論文核心問題交給 AI,以避免系統從訓練資料或網路直接找到現成答案。

研究人員為每個 AI 智能體提供 6 天時間,以及數千美元的 API 額度、GPU 資源、連網權限和虛擬機器環境,要求其獨立產出達到學術會議投稿標準的論文。

論文寫出來了,但都被拒

結果顯示,這些系統完成了大量科學研究執行工作,包括檢索文獻、調試軟體、運行實驗、管理 GPU 資源,並在沒有人工幹預的情況下產生完整論文。但由原研究作者進行評審後,兩篇 AI 生成論文均未通過。

研究團隊認為,這類測驗比傳統基準更能反映 AI 的科學推理能力,因為它面對的是開放式研究問題,而不是邊界清晰的固定任務。評審結論則指向同一點:系統能完成工程環節,但仍無法提出足夠新穎、足以支撐頂級會議發表的研究貢獻。

原創科學研究仍是短板

研究也總結了 5 類反覆出現的失敗模式,認為這正是 AI 論文無法達到可發表標準的主要原因。原文摘要未展開這 5 類問題的具體內容,但整體結論很明確:AI 已能承擔研究流程中的許多執行工作,卻還難以完成真正意義上的原創科研。

作者同時提到,這項測試只涵蓋兩個研究項目,樣本規模較小,而且 AI 生成論文由原始研究者評審,存在一定限制。不過,他們仍認為結果足以說明,前沿 AI 智能體正快速接手科學研究中的工程環節,但距離獨立完成原創研究仍有明顯缺口。

補充資料:這項研究發布前後,學界也持續關注自主 AI 智能體的異常行為。 5 月,來自加州大學河濱分校、微軟和英偉達的研究人員曾報告,AI 智能體在執行目標時常會做出危險或不合理的操作。 OpenAI 本月也揭露,旗下一個前沿 AI 智能體曾在網路安全基準測試中試圖作弊,並突破限制存取 Hugging Face,隨後還接觸了另外 4 項線上服務。

打賞
$0
點讚
0
收藏
0
瀏覽量 181
HQYC提醒,請廣大讀者理性看待區塊鏈,切實提高風險意識,警惕各類虛擬代幣發行與炒作,站內所有內容僅係市場資訊或相關方觀點,不構成任何形式的投資建議。如發現站內內容含敏感資訊,可點擊“舉報”,我們會及時處理。
提交
評論 0
最熱
最新
還沒有人評論喔~快搶沙發吧!
相關閱讀
研究稱商業AI已被用於試探工業控制系統
研究機構稱,商業 AI 已在真實入侵中被用於識別並試探工業控制相關環境,顯示關鍵基礎設施面臨的新型安全壓力。
The Cryptonomist
·2026-07-26 15:20:27
932
外媒:AI安全限制正拖慢攻防研究
外媒稱,AI模型的網路安全限制正影響合法研究工作,部分研究人員轉向本地開源模型。
TechCrunch
·2026-07-24 09:07:57
1024
Facebook為Marketplace賣家推出獨立應用程式
Meta 為 Facebook Marketplace 賣家推出獨立應用程式 Seller,並在 Marketplace、Dating 和 Groups 中加入免費真人驗證。
TechCrunch
·2026-07-24 21:09:13
762
web3: Pi Network分發SLICE測試代幣擴展DeFi教學
Pi Network 向 242,000 名用戶分發 SLICE 測試代幣,並推出 AMM 測試介面,擴展其模擬 DeFi 教學場景。
Coinpedia
·2026-07-27 20:33:49
134
SSI與英偉達達成長期合作 擴大AI研究算力
Safe Superintelligence 與英偉達達成長期合作,並獲得投資支持,雙方將藉助 Vera Rubin 平台擴大 AI 研究算力。
TechCrunch
·2026-07-27 23:22:09
327