ARC-AGI-3拆出两个排行榜:裸模型不到1%,加Agent框架后首日即达36%
2026-07-30 15:40:03
币界网消息,ARC-AGI-3论文将评测拆分为两个排行榜。裸模型得分不到1%,而加上Agent框架后首日即达36%。官方排行榜禁止外部harness,所有模型使用同一极简提示词,不提供工具,测的是模型脱离脚手架后的原生智能。社区排行榜则允许harness,得分自报,ARC Prize默认不验证,论文明确提醒「不应将社区排行榜上的分数解读为AGI进展的证据」。在官方排行榜上,前沿模型得分均低于1%。OpenAI称评测框架拖累GPT-5.6表现,但Opus 5用同一框架分数高2.3倍。OpenAI随后用自家Responses API重做评测框架,保留历史推理,并压缩过长的上下文,结果GPT-5.6的得分从13.3%升至38.3%。但问题在于,Opus 5用的也是这套通用框架,得分为30.2%。框架确实拖累了GPT-5.6,却没有同样拖垮Opus 5。
利好 0
利空 0
来源:互联网
本内容只为提供市场信息,不构成投资建议。