OpenAI 在 9 月 29 日的开发者大会 DevDay 上发布 GPT-6.1 Sol。根据 OpenAI 官方博客,这款新模型在代理式程序开发、电脑操作和专业工作上的表现接近旗舰 GPT-6 Astra,但输入与输出的标准价格只有 Astra 的五分之一。
API 定价方面,GPT-6.1 Sol 每百万 token 输入 2 美元、输出 10 美元,重复使用上下文的缓存输入价格为 0.1 美元。OpenAI 表示,这一缓存价格比标准输入便宜 95%,也比 GPT-6 Sol 的缓存价格再低一半。
GPT-6.1 Sol 是 9 月 22 日推出的 GPT-6 Sol 升级版。就在 DevDay 前一天,外界传出 OpenAI 放弃发布 GPT-6.1 Astra,原因是安全评估未达标;OpenAI 发言人当时表示,还有其他模型即将推出。
DeepSWE 追平 Astra,科学任务单题成本 5.47 美元
OpenAI 公布的测试结果显示,在真实代码库软件工程测试 DeepSWE v1.1 中,GPT-6.1 Sol 追平 GPT-6 Astra,成本约为后者的五分之一,也比 GPT-6 Sol 的最佳成绩高 6.4 个百分点。
在电脑操作测试 OSWorld 2.0 中,GPT-6.1 Sol 比 GPT-6 Sol 高 7 个百分点,与 Astra 只差 2.1 个百分点,每题成本约为 Astra 的七分之一。
OpenAI 还将其与 Anthropic 模型进行比较。在考察复杂 PDF 理解能力的 GDP.pdf 测试中,GPT-6.1 Sol 得分高于 Claude Opus 5.5,每题成本不到后者一半;在多步骤商业流程测试 AutomationBench 中,GPT-6.1 Sol 在中等推理强度下比 Opus 5.5 高 2.2 个百分点,成本约为后者的三分之一。
科学研究测试 Terminal-Bench Science 的成本差距更明显。GPT-6.1 Sol 在最高推理强度下平均每题成本为 5.47 美元,Claude Opus 5.5 为 23.21 美元,GPT-6 Astra 为 23.80 美元。不过 Astra 仍以 68.1% 拿下最高分,OpenAI 建议,最困难的科学研究任务仍使用 Astra。
错误率与安全测试数据同步披露
在事实错误方面,OpenAI 选取用户曾反馈前代模型出错的困难提问进行测试。结果显示,在低推理强度下,GPT-6.1 Sol 含错误回答的比例从 GPT-6 Sol 的 11.4% 降至 7.7%。
安全测试中,OpenAI 表示,在搜索工具发生故障时,GPT-6.1 Sol 未如实告知用户的比例为 2.1%,GPT-6 Sol 为 4.9%,Astra 为 1.5%。
Plus 以上用户已可在 ChatGPT Work 和 Codex 使用
OpenAI 表示,GPT-6.1 Sol 即日起向 Plus、Pro、Business、Enterprise 和 Edu 用户开放,可在 ChatGPT Work 与 Codex 中使用,普通 ChatGPT 对话界面暂时还不能直接选择该模型。开发者则可通过 API 使用模型名称 gpt-6.1-sol 调用。
OpenAI 开发者账号称,GPT-6.1 Sol 最适合大型程序重构、深入追查代码库,以及长时间运行的代理任务。
Ultrafast 提供最高每秒 300 token,新方案 Pro 500 用量为 Plus 的 25 倍
OpenAI 在同场活动中还发布了新的付费加速层级 Ultrafast。根据 OpenAI 官方 X 账号,Ultrafast 在 Codex 中的生成速度最高可提升 8 倍,达到每秒 300 个 token,在 API 中最高可提升 6 倍。
Ultrafast 即日起先支持 GPT-6 Astra,可在 Codex、ChatGPT Work 和 API 中使用,GPT-6.1 Sol 版本将在未来几天推出。
如果要在 Codex 和 ChatGPT Work 中使用 Ultrafast,用户需要订阅新方案 Pro 500。OpenAI 表示,这是其用量上限最高的方案,额度为 Plus 的 25 倍。

