OpenAI 8 月 24 日公布与 AWS 联合完成的一项测试结果称,在 Terminal-Bench 2.1 上,GPT-5.6 Terra 通过 Kiro 完成一个成功任务的成本下降约 82%。Kiro 是 AWS 的软件开发智能体平台,覆盖 IDE、CLI 和 Web。

这一下降并不是官方价格直接下调 82%。根据文中信息,Terra 最近一次调价发生在 7 月 30 日,降幅为 20%。也就是说,单价只下调了 20%,但在测试环境里,单个成功任务的账单降幅达到约 82%。
测试结果披露时间线
GPT-5.6 进入 Kiro 是 2026 年 7 月的事。7 月 13 日,AWS 宣布 GPT-5.6 Sol、Terra、Luna 在 Amazon Bedrock 正式可用。次日,Kiro 在博客中宣布,这三款模型已上线 IDE、CLI 和 Web。
这是 OpenAI 模型首次进入 Kiro,时间点也正好落在 Kiro 公开预览满一周年附近。文章称,在模型上线一个多月后,OpenAI 披露了与 AWS 对 Kiro 环境和 OpenAI 模型联合调优后的测试结果:Terra 完成一个成功任务的成本下降约 82%。
成本下降的部分来自减少无效调用
文中指出,7 月 30 日那轮调价中,Terra 仅下调 20%,而 Kiro 测试中的单任务成本降幅达到 82%,两者之间的差额,主要不是每次调用价格本身继续下降,而是执行任务过程中原本会被浪费掉的调用成本减少了。

按照文中给出的解释,节省可能来自几个方向:模型生成的 token 更少,工具往返调用次数更少,失败后的重试更少,任务执行中的绕路更少。
文章将这部分节省概括为「走弯路的钱」减少。因为在真实开发流程里,智能体即便任务失败、路径选择错误,或中途多次偏航再回退,过程中消耗的 token 仍然会计费。
OpenAI 在官方博客中也提到,效率来自三个层面:发起请求并组织上下文的智能体框架,中间调度请求的编排系统,以及最终在 GPU 上运行的模型本身。
OpenAI 提到模型分工可影响总成本
除单一模型能力外,文章还提到一种编码工作流:先用 Sol 处理问题分析和计划制定,再切换到 Luna 执行已定义清楚的改动、编写测试并运行评估。

按这一思路,同一条开发流水线可由不同档位的模型分别承担不同环节,成本控制不只取决于模型单价,也取决于任务拆分方式。
Terminal-Bench 2.1 测的是「智能体+模型」组合
文中强调,Terminal-Bench 2.1 并不是让模型单独作答,而是将模型放入终端环境,给出相对模糊的目标,让它自行规划路径、调用工具、编写脚本、处理报错并反复迭代。因此,最终成绩反映的是「智能体+模型」这一组合的表现,而不只是底层模型本身。
文章列出了公开榜单中的四组数据:
- Claude Code 配 Fable 5:83.8%,552.67 美元;
- Codex 配 GPT-5.5:83.1%,2059.19 美元;
- Codex 配 GPT-5.6 Terra:78.4%,421.15 美元;
- Codex 配 GPT-5.6 Luna:75.7%,241.45 美元。
从这组数据看,Claude Code 配 Fable 5 与 Codex 配 GPT-5.5 的分数只差 0.7 个百分点,但成本相差接近 4 倍。文章据此指出,同一个模型放进不同框架,结合不同的上下文组织方式和工具策略,最终跑出来的价格也会明显不同。
Kiro 将重点放在任务前置拆解
按照 Kiro 官方数据,Terra 在 Coding Agent Index 上得到 77.4 分,略高于 Claude Fable 5 的 77.2 分。文章认为,Terra 的主要卖点并不只是分数本身,而是这一分数对应的价格。

Kiro 的 spec-driven 方法也被放在同一逻辑下解读。文中称,这套流程的核心做法是先不直接写代码,而是把用户提出的模糊目标拆成需求文档、技术设计和可执行任务清单,再交给模型处理。
这样一来,模型接手时面对的不是一句模糊描述,而是一份已经理清的工作内容。文章认为,这一步压缩的正是 Agent 场景中开销最高的一部分,因为模型跑偏、返工和推倒重来所消耗的 token,往往比真正执行明确任务时更多。
此外,Kiro 在流程中还设置了两道检查环节:一是在代码真正修改前先停下来供人工检查,二是在任务完成后自动运行测试进行验证。文章称,这两道环节可以减少返工,从而继续压低成本。
OpenAI 模型在 Kiro 并非全面开放
文章称,一年前 Kiro 还是一个以 spec-driven 为特点的 IDE,模型选择上以 Anthropic 为主。一年后,AWS 已在自家开发智能体平台中加入三档 OpenAI 模型。

目前,Sol、Terra、Luna 已与 Claude 一起出现在同一个模型选择菜单中。不过,这次并不是全面开放。根据文中信息,这三款模型采用渐进式、实验性开放方式,面向 Pro、Pro+、Pro Max 和 Power 用户,仅覆盖美国弗吉尼亚北部和欧洲法兰克福两个区域,并支持跨区域推理。
文章还提到,这批模型在 Kiro 中采用隐藏思维链,用户看不到推理步骤,只能看到最终结果。官方说法是,这是预期行为,不影响输出质量。
Kiro 已跟进 OpenAI 7 月底调价
在 Kiro 7 月 14 日刚上线 GPT-5.6 系列时,同样任务下,Sol 的计费倍率为 2.4 倍,Terra 为 1.2 倍,Luna 为 0.6 倍。
7 月 30 日 OpenAI 完成新一轮降价后,Kiro 次日跟进调整:Luna 从 0.6 倍降至 0.1 倍,Terra 从 1.2 倍降至 1.0 倍,Sol 则维持不变。

文章据此指出,AWS 在开发平台上的策略已经很明确:平台不会只绑定一家模型供应方。在同一个选择器内,OpenAI 与 Anthropic 的模型开始直接竞争,价格与任务完成成本也成为新的比较维度。
对于开发者来说,模型选择时关注的问题,也从「每百万 token 要多少钱」转向「把这件事做完,总共要花多少钱」。
参考来源
OpenAI Devs X 账号链接:https://x.com/OpenAIDevs/status/2091966982015103068
OpenAI 官方博客链接:https://openai.com/index/gpt-5-6-in-kiro/

