Roboflow评测称GPT-5.6 Sol成OpenAI最强视觉模型

Roboflow评测称GPT-5.6 Sol成OpenAI最强视觉模型

N
News Editor
2026-08-18 10:50:11
第三方视觉评测机构 Roboflow 在其 VLM 基准测试中称,GPT-5.6 Sol 在目标检测项目拿到 46.2 分,较 GPT-5.5 的 13.8 分提升逾 3 倍。Terra 和 Luna 分别为 44.7 和 43.3。测试还显示,Sol 在计数和文档版面识别上表现提升,但 OCR 定向信息提取低于 GPT-5.5;OpenAI 也确认,当图片尺寸接近或超过 2000×2000 像素时,Sol 的检测框可能出现不稳定。

第三方视觉评测机构 Roboflow 在自家 VLM 基准中测试了 GPT-5.6 系列后表示,GPT-5.6 Sol 已成为 OpenAI 目前最强的视觉模型。按 Roboflow 项目负责人 SkalskiP 的说法,「GPT-5.6 Sol 是 OpenAI 有史以来最强的视觉模型」。

目标检测分数从 13.8 升至 46.2

Roboflow 这轮测试覆盖了找目标、计数、识别文字和抽取信息等常见视觉任务。目标检测是 GPT 系列过去表现较弱的一项,任务要求模型在图像中把各个对象框出来。

在这一项上,上一代 GPT-5.5 只拿到 13.8 分,而 GPT-5.6 Sol 升至 46.2,提升超过 3 倍。Terra 和 Luna 也排在后面,分数分别为 44.7 和 43.3。

Roboflow评测称GPT-5.6 Sol成OpenAI最强视觉模型 3

Luna 虽然是这一代中价格最低的档位,但其检测成绩仍高于上一代旗舰。

计数和版面识别同步提升

计数任务的成绩也有所上升。GPT-5.6 Sol 的准确率从 GPT-5.5 的 64.9% 提高到 73%,Terra 和 Luna 分别为 67.6% 和 66.2%。

Roboflow 提到,GPT-5.6 在文档版面识别上的表现尤为突出。以 Sol 为例,标题、正文、表格、插图和签名都能较为干净地框出。这类能力直接关系到合同、发票和报表处理,因为许多文档流程的第一步都是先定位需要读取的区域,再进入识别环节。

Roboflow评测称GPT-5.6 Sol成OpenAI最强视觉模型 4

在密集场景里,GPT-5.6 也能处理更多同类物体同时出现的图片,例如药片、鸡蛋这类目标大量堆叠的场景。Roboflow 还举了一个更复杂的例子:在一张靶纸上,仅统计落在指定环数区域内的弹孔。按其描述,Sol 完成了这一任务,不只识别了目标,也遵守了计数规则。

OCR 转写基本持平,定向提取下滑

不过,Sol 并非所有视觉能力都在上升。Roboflow 的测试显示,Sol 的认字能力出现分化。

Roboflow评测称GPT-5.6 Sol成OpenAI最强视觉模型 5

在 OCR 整段转写任务中,Sol 得分 90.7%,略低于 GPT-5.5 的 91.2%。差距不大。但在定向信息提取任务中,也就是不需要全文,只提取单条指定信息,例如从发票中取出日期,Sol 得分 82.5%,低于 GPT-5.5 的 87.6%,下滑约 5 个点。

按 Roboflow 的描述,Sol 能转写手写笔记,也能准确提取日期;对于轮胎弧面上的尺寸编号,以及冰球比赛直播画面中的实时比分,它也能按指定格式输出。出错的案例则出现在药板有效期这类场景,特点是文字较小、竖排、对比度低且伴随反光。

OpenAI:大图下检测框可能失稳

Roboflow 还发现,在部分图片中,Sol 返回的检测框会漂移到与真实物体几乎没有重叠的位置,而且这些框常常呈现异常整齐的排列方式,例如排成一条直线或均匀分布。

Roboflow评测称GPT-5.6 Sol成OpenAI最强视觉模型 6

Roboflow 将相关样例反馈给 OpenAI 后,后者回应称,当图片尺寸达到约 2000×2000 像素或更大时,Sol 会变得不稳定;推理档位调得越低,这种不稳定越明显。

按文中说法,处理办法主要有两种:一是提高推理档位,但 Token 用量、延迟和成本都会随之上升;二是在调用 API 前先缩小图片,或者裁剪图片。

Roboflow评测称GPT-5.6 Sol成OpenAI最强视觉模型 7

成本和速度对比

Roboflow 给出的实测数据显示:

  • Sol:约 2.5 美分/张,约 10 秒
  • Terra:约 1 美分/张,约 6 秒
  • Luna:不到 0.5 美分/张,约 5 秒

对比之下,Gemini 3.5 Flash 每张约 0.8 美分,价格低于 Sol,且在这套基准上的检测和计数成绩仍然领先。Roboflow 据此认为,在高频、大批量的检测和计数任务中,Gemini Flash 仍是更具性价比的方案。

视觉模型竞争转向执行能力

这次测试最突出的变化,是 GPT-5.6 的视觉能力开始从「看懂一张图」走向更具体的执行任务,包括目标定位、画框、计数、空间关系理解和文档版面拆分。

Roboflow评测称GPT-5.6 Sol成OpenAI最强视觉模型 8

Roboflow 的测试结果显示,GPT-5.6 Sol 已在多个视觉任务上较 GPT-5.5 明显提升,但在定向 OCR 提取、超大尺寸图像稳定性以及成本效率上,仍有明确边界。

本文来自微信公众号「新智元」,作者为 ASI启示录。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
40

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。