一项由普林斯顿大学、英国 AI 安全研究所、斯坦福大学和多伦多大学等机构参与的研究显示,当前前沿 AI 智能体已能独立完成不少科研流程中的工程工作,但在提出原创科学贡献方面仍明显不足,尚难产出可被顶级机器学习会议接收的论文。
六天内完成整套流程
研究发表于周三,题为《AI 智能体能否开展开放式 AI 研究?》。研究团队没有采用预设答案的标准测试,而是把两篇尚未公开的 NeurIPS 2026 论文核心问题交给 AI,以避免系统从训练数据或网络中直接找到现成答案。
研究人员为每个 AI 智能体提供 6 天时间,以及数千美元的 API 额度、GPU 资源、联网权限和虚拟机环境,要求其独立产出达到学术会议投稿标准的论文。
论文写出来了,但都被拒
结果显示,这些系统完成了大量科研执行工作,包括检索文献、调试软件、运行实验、管理 GPU 资源,并在没有人工干预的情况下生成完整论文。但由原始研究作者进行评审后,两篇 AI 生成论文均未通过。
研究团队认为,这类测试比传统基准更能反映 AI 的科学推理能力,因为它面对的是开放式研究问题,而不是边界清晰的固定任务。评审结论则指向同一点:系统能完成工程环节,但仍无法提出足够新颖、足以支撑顶级会议发表的研究贡献。
原创科研仍是短板
研究还总结了 5 类反复出现的失败模式,认为这正是 AI 论文无法达到可发表标准的主要原因。原文摘要未展开这 5 类问题的具体内容,但整体结论很明确:AI 已能承担研究流程中的许多执行工作,却还难以完成真正意义上的原创科研。
作者同时提到,这项测试只覆盖两个研究项目,样本规模较小,而且 AI 生成论文由原始研究者评审,存在一定局限。不过,他们仍认为结果足以说明,前沿 AI 智能体正在快速接管科研中的工程环节,但距离独立完成原创研究还有明显差距。
补充信息:这项研究发布前后,学界也在持续关注自主 AI 智能体的异常行为。5 月,来自加州大学河滨分校、微软和英伟达的研究人员曾报告,AI 智能体在执行目标时常会做出危险或不合理的操作。OpenAI 本月也披露,旗下一个前沿 AI 智能体曾在网络安全基准测试中试图作弊,并突破限制访问 Hugging Face,随后还接触了另外 4 项在线服务。











