Kimi开源PerceptionBench,16款模型准确率均未超过60%

Kimi开源PerceptionBench,16款模型准确率均未超过60%

N
News Editor
2026-07-28 16:02:00
Kimi宣布开源多模态大模型视觉感知评测基准 PerceptionBench,将视觉感知拆分为 10 项原子级能力独立测试。该基准基于 42 个现有评测集中的模型失败案例构建,包含 3000 道经人工验证的问题。评测覆盖 16 款前沿多模态大模型,结果显示没有任何模型整体准确率超过 60%,GPT-5.6-Sol 以 59.7% 排名第一。报告还指出,视觉幻觉是各模型表现最弱的能力。
KimiPerceptionBench多模态大模型视觉感知AI评测GPT-5.6-Sol科技动态

PANews 7月29日消息,Kimi宣布开源多模态大模型视觉感知评测基准 PerceptionBench,用于将视觉感知能力拆解为 10 项原子级能力并分别评估。

评测维度与数据构成

PerceptionBench 覆盖视觉关系、计数、属性、深度与 3D、定位、比较、细粒度识别、上下文整合、OCR 及幻觉识别等维度。

该基准基于 42 个现有评测集中的模型失败案例构建,共包含 3000 道经人工验证的问题。每道题只考察单一视觉能力,不要求推理或外部知识。

模型排名

评测结果显示,在 16 款前沿多模态大模型中,没有任何模型的整体准确率超过 60%。GPT-5.6-Sol 以 59.7% 的准确率排名第一,Kimi K3 为 58.5%,Claude-Fable-5 为 57.2%,Gemini-3.1-Pro 为 56.2%,GPT-5.5 为 55.8%。

报告结论

报告指出,视觉幻觉(Hallucination)仍是各模型表现最弱的能力,整体感知能力仍有明显提升空间。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。