Harness Engineering走红:拆解AI Agent落地7大工程模块

Harness Engineering走红:拆解AI Agent落地7大工程模块

N
News Editor 01
2026-07-22 10:40:13
Harness Engineering正成为AI Agent落地的核心议题。文章梳理其定义、兴起时间线,以及Context、Tool、Permission、Memory、Hook、Sub-agent、Prompt Cache七大模块。
AI AgentHarness EngineeringMCPClaude CodePrompt Cache

Harness Engineering 正在成为 AI Agent 工程里的高频词。它讨论的不是模型本身,而是围绕 LLM 搭建的一整套控制与执行系统。按文中的定义,业内常用的表达是 Agent = Model + Harness,也就是模型之外的上下文管理、工具调用、权限控制、记忆系统、钩子机制、多代理协作和缓存策略,共同决定一个 Agent 能否在真实��境中稳定运行。

文章指出,Prompt Engineering 关注单次提示词,Context Engineering 处理单轮对话中该放入哪些信息,而 Harness Engineering 的范围更大,覆盖前两者,并延伸到系统架构、工具集成、安全控制和跨会话记忆等完整生命周期。它对应的不是“怎么把一句话写好”,而是“怎么让 AI 在生产环境里可控地做事”。

从 MCP 到 Claude Code,概念为何快速升温

素材给出了一条较清晰的时间线。2024 年 11 月 26 日,Anthropic 发布 MCP,作为 AI 助手连接外部数据系统的开放标准,社区随后建立了数千个 MCP Server,把数据库、代码编辑器、浏览器、Slack、GitHub 和 CRM 等系统接入 Agent 工作流。工具生态扩张后,如何统一管理这些能力,成了新问题。

2025 年 2 月,Claude Code 研究预览上线,其工程规模被视作生产级 Harness 的样板:1,884 个文件、512K 行代码、7 个安全层、5 个 Compaction 阶段、54 个工具、27 个 Hook 事件、4 种扩展机制、7 种 Permission 模式。同年 5 月正式版上线,Anthropic 还发布了与 Prompt Caching 相关的工程笔记。到 2025 年 11 月,OpenAI 发布 Codex CLI 与 GPT-5.5-Codex,并支持 AGENTS.md 和 MCP,跨工具的 Harness 配置开始形成共识。

文中还提到,2025 年 6 月 27 日,Simon Willison 将 Context Engineering 进一步明确为独立学科。背后的共识很直接:模型能力逼近上限后,工程封装本身正在成为 AI Agent 竞争的关键变量。

七大模块里,Context 和 Tool 是最先碰到的基础层

在七个模块中,Context 管理被列为核心战场。上下文窗口本质上就是 AI 的工作记忆,容量有限,放什么、怎么排、哪些信息延后加载,都会影响输出质量。文中以 Claude Code 为例,把 Context 分为 System Prompt 层、CLAUDE.md 或 AGENTS.md 项目配置层、工具清单层和对话历史层。对话变长后,系统会依靠 Compaction 机制压缩旧内容,Claude Code 设有 5 个独立的 Compaction 阶段,按长度自动触发。

Tool 设计则决定 Agent 能否真正与外部世界交互。MCP 出现前,不同 AI 工具各自维护私有协议;MCP 发布后,工具提供方和 AI Agent 可以通过统一标准通信。素材强调,工具描述必须让 LLM 易于理解,命名要清晰,输出既要结构化,也要让模型能在后续上下文里高效使用。Claude Code 虽然有 54 个官方工具,但并不会一次性全部塞入窗口,而是采用延迟加载策略,为缓存命中率和关键信息留出空间。

权限、记忆和 Hook,决定Agent能否安全长期运行

Permission 系统是文中反复强调的安全底座。Claude Code 采用 7 种 Permission 模式,从只规划不执行的 plan,到较开放的 dontAsk 和 bypassPermissions,配合默认拒绝未授权操作的 Deny-First 逻辑,形成多层防护。素材引用 Anthropic 对并行安全层的描述,说明任何一层都可以阻止动作执行。

Hook 系统提供更细的控制粒度。文章提到,Claude Code 支持 27 个 Hook 事件,覆盖工具执行前后、对话开始结束以及权限决策等环节。PreToolUse Hook 可执行 allow、deny、ask、defer 四种控制,还能直接修改工具输入。文中给出的例子是把对生产数据库的写入,自动重定向到测试数据库,从而在不改变 Agent 表面行为的前提下实施安全策略。

Memory 与 Compaction 则面向持续使用场景。长对话靠压缩腾出窗口,跨会话记忆则通过 Memory Tool 维护,让 Agent 可以主动决定记住什么、忘掉什么,而不是完全依赖系统自动保存。

Sub-agent 与 Prompt Cache,把性能和成本问题摆到台前

在更复杂的任务里,Sub-agent 架构被视为“让 AI 管理 AI”的方式。主代理负责规划和协调,把子任务分发给多个子代理并行执行,再汇总结果。素材称,每个 Sub-agent 都在独立进程中运行,拥有自己的上下文窗口和 Prompt Cache,这样既能隔离失败影响,也有利于提高缓存命中率。

Prompt Cache 则是最容易量化收益的模块之一。文中提到,Anthropic 的 Prompt Caching 机制中,缓存写入成本为正常的 25%,缓存读取成本为正常的 10%,延迟降低 2 倍。在高频调用场景下,命中率的小幅提升都可能显著改变 API 成本结构。

文章最后没有把 Harness Engineering 描述成一套现成答案,而是把问题摆得很清楚:提示词注入、上下文漂移、评测标准缺失、成本与延迟取舍、以及 LLM 输出的可重现性,都是实际部署时绕不开的工程难题。按素材的判断,到了 2026 年,任何想认真推动 AI Agent 落地的团队,都很难绕开这门基础设施课。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
600

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。