“再过 2-3 个月,Codex 就是个原始工具了。”
这句话并非来自竞争对手,而是出自现任 OpenAI 产品兼平台总经理 Thibault Sottiaux。根据文中说法,Thibault Sottiaux 负责 ChatGPT 和 Codex 相关产品。
最近一段时间,Harness 框架的使用范围正在扩大。文章称,从开发者到白领,越来越多人开始使用这类 Agent 工具,并从 AI 自动化中获得效率提升。在这一类工具中,OpenAI 的 Codex 被列为代表性产品。
不过,Thibault Sottiaux 给出的判断是,AI 智能体下一步可能不只是工具层面的升级,而是会从单机小工具转向“云原生基础设施”的演进路径。
本地 Harness 面临三类限制
文中提到,所谓 Harness,是围绕大模型构建的一整套能力,包括上下文管理、工具调用、状态持久化、环境隔离和异常恢复。当前不少开发者仍主要依赖在笔记本电脑上运行 Agent 完成任务,常见形式包括通过 CLI、Cursor、Claude Code 或轻量 Agent 逻辑执行工作流。
与此同时,多工具、多模型协同使用也越来越常见。文中举例称,开发者可能会先用 Claude Code 上的 Fable 5 编写项目文档,再到 Codex 上调用其他模型执行任务。
但在面向下一代前沿模型时,这种模式会遇到三方面瓶颈。
算力与内存限制
如果智能体需要并发执行 20 个子任务,例如同时跑测试、抓取数据、编译大型项目,本地笔记本的内存、CPU 以及并发沙箱资源都会很快被占满。文中提到的并发沙箱包括 Docker 和 VM。
长任务依赖设备持续在线
复杂 Agent 任务可能持续数小时,甚至数天。这意味着用户的笔记本不能关机,不能断网,也不能合盖。文章将这种工程模式描述为“非常反人性”。
上下文和工具链并行管理压力上升
文章判断,下一代模型将支持极长上下文和更高并发推理。本地轻量 Harness 很难处理大规模并发 Agent 之间的上下文压缩、状态同步以及集中式日志追踪。
Codex 已提供云端异步运行
面对上述限制,文章称,Agent 工具正在向更重的基础设施和系统设计方向转型,而且这一趋势在过去几个月里已经逐步显现。

其中一个例子是 OpenAI 的 Codex。文中称,Codex 目前已经支持云端异步运行:用户在终端发出指令后,任务会被送入云端隔离的容器,也就是 Sandbox Container,自主运行;手机或笔记本在这个流程中更多承担指挥和控制作用。
另一条变化路径是云原生微沙箱基础设施的兴起。文章列举了 E2B、Daytona、Fly.io 和 Modal,称这些面向 AI Agent 设计的云端极速沙箱,可以让 Agent 在执行任务时动态拉起数百个独立容器环境,并行运行代码和验证结果。
研发重点正转向系统级 Harness
文章写道,在 OpenAI、Anthropic、Cognition 等 AI 团队内部,工程师的研发重心已经开始从优化 Prompt 转向“编写系统级的 Harness”。
文中还提到一个来自今年 2 月的案例。Anthropic 团队当时展示了一个多 Agent 协同示例:16 个 Claude 并行运行在 2000 个云端 Session 中,最终写出一个 C 语言编译器。文章将这一案例视作生成式 AI 在软件工程领域走向多 Agent 协同的一个里程碑。
在这个案例中,不同 Claude 实例承担了不同角色:1 个架构师 Agent 负责设计抽象语法树(AST),4 个编码 Agent 负责不同模块,2 个测试 Agent 专门编写单元测试,1 个审计 Agent 负责代码流审查和安全性检查。
主导研究员 Nicholas Carlini 在文中表示:“大部分精力都花在了为模型打造环境、测试闭环与反馈基础设施上。”
“本地轻指挥,云端重执行”或成常态
按照文中给出的判断,未来两到三个月,这类智能体工作流可能会逐渐成为日常。结合 Thibault Sottiaux 的表述,文章认为,“本地轻指挥,云端重执行”将成为默认模式,开发者使用的 IDE、Terminal 和 Web UI 会越来越像控制面板。
在这种分工下,真正消耗计算资源的任务——例如代码重构、测试执行、浏览器自动化模拟——将主要在云端动态集群里并行完成,最终再把差异结果和日志以流式方式回传到本地。
文章最后提到,随着模型与 Harness 结合得更深,竞争重点或许会从“谁的模型推理能力更强”转向“谁能更彻底释放模型潜力”。而那些主要依赖本地电脑运行 Python 脚本和简单 API 调用的 Agent 框架,文中认为已经接近能力上限。
本文来自微信公众号“机器之心”(ID:almosthuman2014),作者为泽南。

