PANews 7月29日消息,Kimi宣布开源多模态大模型视觉感知评测基准 PerceptionBench,用于将视觉感知能力拆解为 10 项原子级能力并分别评估。
评测维度与数据构成
PerceptionBench 覆盖视觉关系、计数、属性、深度与 3D、定位、比较、细粒度识别、上下文整合、OCR 及幻觉识别等维度。
该基准基于 42 个现有评测集中的模型失败案例构建,共包含 3000 道经人工验证的问题。每道题只考察单一视觉能力,不要求推理或外部知识。
模型排名
评测结果显示,在 16 款前沿多模态大模型中,没有任何模型的整体准确率超过 60%。GPT-5.6-Sol 以 59.7% 的准确率排名第一,Kimi K3 为 58.5%,Claude-Fable-5 为 57.2%,Gemini-3.1-Pro 为 56.2%,GPT-5.5 为 55.8%。
报告结论
报告指出,视觉幻觉(Hallucination)仍是各模型表现最弱的能力,整体感知能力仍有明显提升空间。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

