AI Agent 科學任務實測:最強也只完整完成20.6%
2026-08-28 21:32:34
幣界網消息,AI 姨報道,陳天橋旗下全新 AI 項目 Apodex 發布科學 Agent 評測 FrontierChallenge,使用97個真實科學工作流測試 AI 是否能從頭到尾完成任務。12個前沿模型參與測試,最好成績僅為20.6%。GPT-5.6 SOL + Codex 和 Grok 4.6 + Claude Code 并列第一,各完整通過20項。測試發現,Agent 经常未完成任務卻聲稱已完成。在使用 Claude Code 作爲 Agent 框架的10組模型測試中,849次失敗任務中有75.5% 最後仍聲稱已完成。所有參評系統在電化學和環境科學任務上的平均得分達到94.9,但沒有一個完整通過。該評測專門將「大部分做對」與「真正交付完成」區分開來。
來源:互聯網
本內容只為提供市場資訊,不構成投資建議。
關注HQYC官方帳號,及時關注最新動態









