25款模型集体输给人类:AI仍看不懂很多生活常识
2026-10-08 19:33:43
币界网消息,OneMillion_AI报道,scale ai旗下研究机构scale labs联合elorian发布的新评测显示,25款多模态模型在测试中集体输给人类,无法理解许多生活常识。研究涵盖522道开放题,涉及288张图片和234段视频,人类受试者的准确率达到93.1%。排名第一的gpt-6 astra仅获得53.6%的准确率,而gpt-6.1 SOL和claude opus分别为46.6%和44.6%。研究发现,94%的模型失败与漏看关键线索、认错对象或无法推断隐含关系有关。社交理解方面,21款模型表现最差,视频题普遍比图片题更难。尽管增加推理量,模型表现仍未能赶上人类。
来源:互联网
本内容只为提供市场信息,不构成投资建议。
关注HQYC官方账号,及时关注最新动态









