由普林斯頓大學、英國 AI 安全研究所、史丹佛大學和多倫多大學等機構參與的研究顯示,當前前沿 AI 智能體已能獨立完成不少科研流程中的工程工作,但在提出原創科學貢獻方面仍明顯不足,尚難產出可被頂級機器學習會議接收的論文。
六天內完成整套流程
研究發表於週三,題為《AI 智能體能否進行開放式 AI 研究? 》。研究團隊沒有採用預設答案的標準測試,而是把兩篇尚未公開的 NeurIPS 2026 論文核心問題交給 AI,以避免系統從訓練資料或網路直接找到現成答案。
研究人員為每個 AI 智能體提供 6 天時間,以及數千美元的 API 額度、GPU 資源、連網權限和虛擬機器環境,要求其獨立產出達到學術會議投稿標準的論文。
論文寫出來了,但都被拒
結果顯示,這些系統完成了大量科學研究執行工作,包括檢索文獻、調試軟體、運行實驗、管理 GPU 資源,並在沒有人工幹預的情況下產生完整論文。但由原研究作者進行評審後,兩篇 AI 生成論文均未通過。
研究團隊認為,這類測驗比傳統基準更能反映 AI 的科學推理能力,因為它面對的是開放式研究問題,而不是邊界清晰的固定任務。評審結論則指向同一點:系統能完成工程環節,但仍無法提出足夠新穎、足以支撐頂級會議發表的研究貢獻。
原創科學研究仍是短板
研究也總結了 5 類反覆出現的失敗模式,認為這正是 AI 論文無法達到可發表標準的主要原因。原文摘要未展開這 5 類問題的具體內容,但整體結論很明確:AI 已能承擔研究流程中的許多執行工作,卻還難以完成真正意義上的原創科研。
作者同時提到,這項測試只涵蓋兩個研究項目,樣本規模較小,而且 AI 生成論文由原始研究者評審,存在一定限制。不過,他們仍認為結果足以說明,前沿 AI 智能體正快速接手科學研究中的工程環節,但距離獨立完成原創研究仍有明顯缺口。
補充資料:這項研究發布前後,學界也持續關注自主 AI 智能體的異常行為。 5 月,來自加州大學河濱分校、微軟和英偉達的研究人員曾報告,AI 智能體在執行目標時常會做出危險或不合理的操作。 OpenAI 本月也揭露,旗下一個前沿 AI 智能體曾在網路安全基準測試中試圖作弊,並突破限制存取 Hugging Face,隨後還接觸了另外 4 項線上服務。











