第三方视觉评测机构 Roboflow 在自家 VLM 基准中测试了 GPT-5.6 系列后表示,GPT-5.6 Sol 已成为 OpenAI 目前最强的视觉模型。按 Roboflow 项目负责人 SkalskiP 的说法,「GPT-5.6 Sol 是 OpenAI 有史以来最强的视觉模型」。
目标检测分数从 13.8 升至 46.2
Roboflow 这轮测试覆盖了找目标、计数、识别文字和抽取信息等常见视觉任务。目标检测是 GPT 系列过去表现较弱的一项,任务要求模型在图像中把各个对象框出来。
在这一项上,上一代 GPT-5.5 只拿到 13.8 分,而 GPT-5.6 Sol 升至 46.2,提升超过 3 倍。Terra 和 Luna 也排在后面,分数分别为 44.7 和 43.3。

Luna 虽然是这一代中价格最低的档位,但其检测成绩仍高于上一代旗舰。
计数和版面识别同步提升
计数任务的成绩也有所上升。GPT-5.6 Sol 的准确率从 GPT-5.5 的 64.9% 提高到 73%,Terra 和 Luna 分别为 67.6% 和 66.2%。
Roboflow 提到,GPT-5.6 在文档版面识别上的表现尤为突出。以 Sol 为例,标题、正文、表格、插图和签名都能较为干净地框出。这类能力直接关系到合同、发票和报表处理,因为许多文档流程的第一步都是先定位需要读取的区域,再进入识别环节。

在密集场景里,GPT-5.6 也能处理更多同类物体同时出现的图片,例如药片、鸡蛋这类目标大量堆叠的场景。Roboflow 还举了一个更复杂的例子:在一张靶纸上,仅统计落在指定环数区域内的弹孔。按其描述,Sol 完成了这一任务,不只识别了目标,也遵守了计数规则。
OCR 转写基本持平,定向提取下滑
不过,Sol 并非所有视觉能力都在上升。Roboflow 的测试显示,Sol 的认字能力出现分化。

在 OCR 整段转写任务中,Sol 得分 90.7%,略低于 GPT-5.5 的 91.2%。差距不大。但在定向信息提取任务中,也就是不需要全文,只提取单条指定信息,例如从发票中取出日期,Sol 得分 82.5%,低于 GPT-5.5 的 87.6%,下滑约 5 个点。
按 Roboflow 的描述,Sol 能转写手写笔记,也能准确提取日期;对于轮胎弧面上的尺寸编号,以及冰球比赛直播画面中的实时比分,它也能按指定格式输出。出错的案例则出现在药板有效期这类场景,特点是文字较小、竖排、对比度低且伴随反光。
OpenAI:大图下检测框可能失稳
Roboflow 还发现,在部分图片中,Sol 返回的检测框会漂移到与真实物体几乎没有重叠的位置,而且这些框常常呈现异常整齐的排列方式,例如排成一条直线或均匀分布。

Roboflow 将相关样例反馈给 OpenAI 后,后者回应称,当图片尺寸达到约 2000×2000 像素或更大时,Sol 会变得不稳定;推理档位调得越低,这种不稳定越明显。
按文中说法,处理办法主要有两种:一是提高推理档位,但 Token 用量、延迟和成本都会随之上升;二是在调用 API 前先缩小图片,或者裁剪图片。

成本和速度对比
Roboflow 给出的实测数据显示:
- Sol:约 2.5 美分/张,约 10 秒
- Terra:约 1 美分/张,约 6 秒
- Luna:不到 0.5 美分/张,约 5 秒
对比之下,Gemini 3.5 Flash 每张约 0.8 美分,价格低于 Sol,且在这套基准上的检测和计数成绩仍然领先。Roboflow 据此认为,在高频、大批量的检测和计数任务中,Gemini Flash 仍是更具性价比的方案。
视觉模型竞争转向执行能力
这次测试最突出的变化,是 GPT-5.6 的视觉能力开始从「看懂一张图」走向更具体的执行任务,包括目标定位、画框、计数、空间关系理解和文档版面拆分。

Roboflow 的测试结果显示,GPT-5.6 Sol 已在多个视觉任务上较 GPT-5.5 明显提升,但在定向 OCR 提取、超大尺寸图像稳定性以及成本效率上,仍有明确边界。
本文来自微信公众号「新智元」,作者为 ASI启示录。

