Scale AI 旗下研究机构 Scale Labs 联合 Elorian 发布新评测 Humanity’s Sixth Sense(HSS),专门测试 AI 能否从图片和视频中识别隐含信息。
这套评测包含 522 道开放题,覆盖 288 张图片和 234 段视频,题目聚焦生活场景中的常识判断,例如两辆车之间能否通过、女子追公交时为何突然放慢脚步,以及一个场合中谁更有话语权。
研究团队测试了 25 款多模态模型,并安排 20 名人类受试者参与答题。结果显示,人类准确率达到 93.1%,排名第一的 GPT-6 Astra 即使在最大推理力度下,准确率也只有 53.6%。GPT-6.1 Sol 和 Claude Opus 5.5 分别为 46.6% 和 44.6%,全部模型的得分中位数仅 30.9%。
研究人员分析了 8573 次模型失败案例,发现其中 94% 与漏看关键线索、认错对象,或无法推断画面中的隐含关系有关。只有约 5% 被归类为逻辑推理错误。
从细分表现看,社交理解是最难的一类题目,25 款模型中有 21 款在这一类别上的成绩最差。视频题整体也普遍比图片题更难。
研究还提到,增加推理量未必能改善结果。模型平均每题消耗约 4000 个推理 token,部分题目中,推理时间越长,成绩反而越差。团队也尝试让 Agent 对画面进行放大、裁剪和反复检查,分数虽有提升,但与人类仍存在明显差距。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

