OpenAI高管称Codex类Harness两三个月内将显得原始

OpenAI高管称Codex类Harness两三个月内将显得原始

N
News Editor
2026-08-09 03:17:07
OpenAI 产品兼平台总经理 Thibault Sottiaux 表示,再过 2 至 3 个月,Codex 这类 Harness 就会显得原始。他指出,当前在本地笔记本上运行 Agent 的方式正遭遇算力、内存、长时任务和并发管理等限制。文章提到,Codex 已提供云端异步运行支持,E2B、Daytona、Fly.io、Modal 等云端微沙箱基础设施也在兴起,AI 团队的研发重点正从优化 Prompt 转向编写系统级 Harness。

“再过 2-3 个月,Codex 就是个原始工具了。”

这句话并非来自竞争对手,而是出自现任 OpenAI 产品兼平台总经理 Thibault Sottiaux。根据文中说法,Thibault Sottiaux 负责 ChatGPT 和 Codex 相关产品。

最近一段时间,Harness 框架的使用范围正在扩大。文章称,从开发者到白领,越来越多人开始使用这类 Agent 工具,并从 AI 自动化中获得效率提升。在这一类工具中,OpenAI 的 Codex 被列为代表性产品。

不过,Thibault Sottiaux 给出的判断是,AI 智能体下一步可能不只是工具层面的升级,而是会从单机小工具转向“云原生基础设施”的演进路径。

本地 Harness 面临三类限制

文中提到,所谓 Harness,是围绕大模型构建的一整套能力,包括上下文管理、工具调用、状态持久化、环境隔离和异常恢复。当前不少开发者仍主要依赖在笔记本电脑上运行 Agent 完成任务,常见形式包括通过 CLI、Cursor、Claude Code 或轻量 Agent 逻辑执行工作流。

与此同时,多工具、多模型协同使用也越来越常见。文中举例称,开发者可能会先用 Claude Code 上的 Fable 5 编写项目文档,再到 Codex 上调用其他模型执行任务。

但在面向下一代前沿模型时,这种模式会遇到三方面瓶颈。

算力与内存限制

如果智能体需要并发执行 20 个子任务,例如同时跑测试、抓取数据、编译大型项目,本地笔记本的内存、CPU 以及并发沙箱资源都会很快被占满。文中提到的并发沙箱包括 Docker 和 VM。

长任务依赖设备持续在线

复杂 Agent 任务可能持续数小时,甚至数天。这意味着用户的笔记本不能关机,不能断网,也不能合盖。文章将这种工程模式描述为“非常反人性”。

上下文和工具链并行管理压力上升

文章判断,下一代模型将支持极长上下文和更高并发推理。本地轻量 Harness 很难处理大规模并发 Agent 之间的上下文压缩、状态同步以及集中式日志追踪。

Codex 已提供云端异步运行

面对上述限制,文章称,Agent 工具正在向更重的基础设施和系统设计方向转型,而且这一趋势在过去几个月里已经逐步显现。

OpenAI高管称Codex类Harness两三个月内将显得原始 3

其中一个例子是 OpenAI 的 Codex。文中称,Codex 目前已经支持云端异步运行:用户在终端发出指令后,任务会被送入云端隔离的容器,也就是 Sandbox Container,自主运行;手机或笔记本在这个流程中更多承担指挥和控制作用。

另一条变化路径是云原生微沙箱基础设施的兴起。文章列举了 E2B、Daytona、Fly.io 和 Modal,称这些面向 AI Agent 设计的云端极速沙箱,可以让 Agent 在执行任务时动态拉起数百个独立容器环境,并行运行代码和验证结果。

研发重点正转向系统级 Harness

文章写道,在 OpenAI、Anthropic、Cognition 等 AI 团队内部,工程师的研发重心已经开始从优化 Prompt 转向“编写系统级的 Harness”。

文中还提到一个来自今年 2 月的案例。Anthropic 团队当时展示了一个多 Agent 协同示例:16 个 Claude 并行运行在 2000 个云端 Session 中,最终写出一个 C 语言编译器。文章将这一案例视作生成式 AI 在软件工程领域走向多 Agent 协同的一个里程碑。

在这个案例中,不同 Claude 实例承担了不同角色:1 个架构师 Agent 负责设计抽象语法树(AST),4 个编码 Agent 负责不同模块,2 个测试 Agent 专门编写单元测试,1 个审计 Agent 负责代码流审查和安全性检查。

主导研究员 Nicholas Carlini 在文中表示:“大部分精力都花在了为模型打造环境、测试闭环与反馈基础设施上。”

“本地轻指挥,云端重执行”或成常态

按照文中给出的判断,未来两到三个月,这类智能体工作流可能会逐渐成为日常。结合 Thibault Sottiaux 的表述,文章认为,“本地轻指挥,云端重执行”将成为默认模式,开发者使用的 IDE、Terminal 和 Web UI 会越来越像控制面板。

在这种分工下,真正消耗计算资源的任务——例如代码重构、测试执行、浏览器自动化模拟——将主要在云端动态集群里并行完成,最终再把差异结果和日志以流式方式回传到本地。

文章最后提到,随着模型与 Harness 结合得更深,竞争重点或许会从“谁的模型推理能力更强”转向“谁能更彻底释放模型潜力”。而那些主要依赖本地电脑运行 Python 脚本和简单 API 调用的 Agent 框架,文中认为已经接近能力上限。

本文来自微信公众号“机器之心”(ID:almosthuman2014),作者为泽南。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
650

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。