ARC-AGI-3 拆出兩個排行榜:裸模型不到1%,加入 Agent 框架後首日即達36%
2026-07-30 15:40:03
幣界網消息,ARC-AGI-3論文將評測拆分為兩個排行榜。裸模型得分不到1%,而加上Agent框架後首日即達36%。官方排行榜禁止外部harness,所有模型使用同一極簡提示詞,不提供工具,測的是模型脫離腳手架後的原生智能。社區排行榜則允許harness,得分自報,ARC Prize默认不驗證,論文明確提醒「不應將社區排行榜上的分數解讀爲AGI進展的證據」。在官方排行榜上,前沿模型得分均低於1%。OpenAI稱評測框架拖累了GPT-5.6表現,但Opus使用同一框架得分高2.3倍。OpenAI隨後用自家Responses API重做評測框架,保留歷史推理,並壓縮過長的上下文,結果GPT-5.6的得分從13.3%升至38.3%。但問題在於,Opus使用的也是這套通用框架,得分为30.2%。框架確實拖累了GPT-5.6,卻沒有同樣拖垮Opus。
利好 0
利空 0
來源:互聯網
本內容只為提供市場資訊,不構成投資建議。