ARC-AGI-3拆出两个排行榜:裸模型不到1%,加Agent框架后首日即达36%
2026-07-30 15:40:03
币界网消息,ARC-AGI-3论文将评测拆分为两个排行榜。裸模型得分不到1%,而加上Agent框架后首日即达36%。官方排行榜禁止外部harness,所有模型使用同一极简提示词,不提供工具,测的是模型脱离脚手架后的原生智能。社区排行榜则允许harness,得分自报,ARC Prize默认不验证,论文明确提醒「不应将社区排行榜上的分数解读为AGI进展的证据」。在官方排行榜上,前沿模型得分均低于1%。OpenAI称评测框架拖累GPT-5.6表现,但Opus 5用同一框架分数高2.3倍。OpenAI随后用自家Responses API重做评测框架,保留历史推理,并压缩过长的上下文,结果GPT-5.6的得分从13.3%升至38.3%。但问题在于,Opus 5用的也是这套通用框架,得分为30.2%。框架确实拖累了GPT-5.6,却没有同样拖垮Opus 5。
出典:互联网
このコンテンツは市場情報のみを提供するものであり、投資アドバイスを構成するものではありません。
HQYC公式アカウントをフォローして最新情報を入手
人気記事
更新

web3: Avalanche testnet launches Hel token issuance and upgrades.

web3: Ripple CEO to attend closed-door blockchain meeting in Wyoming

Ethereum: Ethereum is fluctuating below $2,000, and ETFs have turned to net outflows.

Web3: Nvidia CDS hits new high as market focuses on AI spending.

Web3: Seoul Police: Fake Flare Staking Website Scammed $8.5 Million in XRP

