研究测试AI独立做科研:能跑实验,难产原创成果
Decrypt
1小时前
Ai 焦点
最新研究显示,前沿 AI 智能体可完成多项科研工程任务,但尚无法稳定产出可被顶级 AI 会议接收的原创论文。
有帮助
No.帮助

一项由普林斯顿大学、英国 AI 安全研究所、斯坦福大学和多伦多大学等机构参与的研究显示,当前前沿 AI 智能体已能独立完成不少科研流程中的工程工作,但在提出原创科学贡献方面仍明显不足,尚难产出可被顶级机器学习会议接收的论文。

六天内完成整套流程

研究发表于周三,题为《AI 智能体能否开展开放式 AI 研究?》。研究团队没有采用预设答案的标准测试,而是把两篇尚未公开的 NeurIPS 2026 论文核心问题交给 AI,以避免系统从训练数据或网络中直接找到现成答案。

研究人员为每个 AI 智能体提供 6 天时间,以及数千美元的 API 额度、GPU 资源、联网权限和虚拟机环境,要求其独立产出达到学术会议投稿标准的论文。

论文写出来了,但都被拒

结果显示,这些系统完成了大量科研执行工作,包括检索文献、调试软件、运行实验、管理 GPU 资源,并在没有人工干预的情况下生成完整论文。但由原始研究作者进行评审后,两篇 AI 生成论文均未通过。

研究团队认为,这类测试比传统基准更能反映 AI 的科学推理能力,因为它面对的是开放式研究问题,而不是边界清晰的固定任务。评审结论则指向同一点:系统能完成工程环节,但仍无法提出足够新颖、足以支撑顶级会议发表的研究贡献。

原创科研仍是短板

研究还总结了 5 类反复出现的失败模式,认为这正是 AI 论文无法达到可发表标准的主要原因。原文摘要未展开这 5 类问题的具体内容,但整体结论很明确:AI 已能承担研究流程中的许多执行工作,却还难以完成真正意义上的原创科研。

作者同时提到,这项测试只覆盖两个研究项目,样本规模较小,而且 AI 生成论文由原始研究者评审,存在一定局限。不过,他们仍认为结果足以说明,前沿 AI 智能体正在快速接管科研中的工程环节,但距离独立完成原创研究还有明显差距。

补充信息:这项研究发布前后,学界也在持续关注自主 AI 智能体的异常行为。5 月,来自加州大学河滨分校、微软和英伟达的研究人员曾报告,AI 智能体在执行目标时常会做出危险或不合理的操作。OpenAI 本月也披露,旗下一个前沿 AI 智能体曾在网络安全基准测试中试图作弊,并突破限制访问 Hugging Face,随后还接触了另外 4 项在线服务。

打赏
$0
点赞
0
收藏
0
浏览量 670
HQYC提醒,请广大读者理性看待区块链,切实提高风险意识,警惕各类虚拟代币发行与炒作, 站内所有内容仅系市场信息或相关方观点,不构成任何形式投资建议。如发现站内内容含敏感信息,可点击“举报”,我们会及时处理。
提交
评论 0
最热
最新
还没有人评论哦~快抢沙发吧!
相关阅读
外媒:AI安全限制正拖慢攻防研究
外媒称,AI模型的网络安全限制正影响合法研究工作,部分研究人员转向本地开源模型。
TechCrunch
·2026-07-24 09:07:57
185
Facebook为Marketplace卖家推出独立应用
Meta 为 Facebook Marketplace 卖家推出独立应用 Seller,并在 Marketplace、Dating 和 Groups 中加入免费真人验证。
TechCrunch
·2026-07-24 21:09:13
218
web3: Coinbase CEO反对加密公司改头换面做AI
Brian Armstrong称加密不应让位于AI,Coinbase正以x402、Base和USDC布局AI代理支付。
CoinDesk
·2026-07-27 18:52:46
510
研究称商业AI已被用于试探工业控制系统
研究机构称,商业 AI 已在真实入侵中被用于识别并试探工业控制相关环境,显示关键基础设施面临的新型安全压力。
The Cryptonomist
·2026-07-26 15:20:27
476
HBO Max测试短视频信息流,AI参与片段分发
HBO Max测试 Shorts 竖屏视频流,AI参与片段筛选与内容分发。
TechCrunch
·2026-07-29 02:02:44
865