Scale Labs 评测显示 25 款多模态模型生活常识判断落后人类

Scale Labs 评测显示 25 款多模态模型生活常识判断落后人类

N
News Editor
2026-10-08 11:32:17
Scale AI 旗下 Scale Labs 联合 Elorian 发布 Humanity’s Sixth Sense 评测,用 288 张图片和 234 段视频中的 522 道开放题测试多模态模型对隐含信息的理解能力。20 名人类受试者准确率为 93.1%,最高分模型 GPT-6 Astra 为 53.6%。研究称,模型失误主要来自漏看线索、认错对象和无法判断隐含关系,社交理解与视频题表现尤其薄弱。

Scale AI 旗下研究机构 Scale Labs 联合 Elorian 发布新评测 Humanity’s Sixth Sense(HSS),专门测试 AI 能否从图片和视频中识别隐含信息。

这套评测包含 522 道开放题,覆盖 288 张图片和 234 段视频,题目聚焦生活场景中的常识判断,例如两辆车之间能否通过、女子追公交时为何突然放慢脚步,以及一个场合中谁更有话语权。

研究团队测试了 25 款多模态模型,并安排 20 名人类受试者参与答题。结果显示,人类准确率达到 93.1%,排名第一的 GPT-6 Astra 即使在最大推理力度下,准确率也只有 53.6%。GPT-6.1 Sol 和 Claude Opus 5.5 分别为 46.6% 和 44.6%,全部模型的得分中位数仅 30.9%。

研究人员分析了 8573 次模型失败案例,发现其中 94% 与漏看关键线索、认错对象,或无法推断画面中的隐含关系有关。只有约 5% 被归类为逻辑推理错误。

从细分表现看,社交理解是最难的一类题目,25 款模型中有 21 款在这一类别上的成绩最差。视频题整体也普遍比图片题更难。

研究还提到,增加推理量未必能改善结果。模型平均每题消耗约 4000 个推理 token,部分题目中,推理时间越长,成绩反而越差。团队也尝试让 Agent 对画面进行放大、裁剪和反复检查,分数虽有提升,但与人类仍存在明显差距。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。