AI编程新学科Harness Engineering:5产物3学派5原则全解析

AI编程新学科Harness Engineering:5产物3学派5原则全解析

N
News Editor 01
2026-07-22 19:35:16
OpenAI小团队零手写完成100万行生产代码,背后是新兴工程学科Harness Engineering。本文拆解5个产物、3大学派与5条普世原则,揭示AI Agent生产力跃升的关键。
Harness EngineeringAI Agent编程范式工程学科2026

2026年2月,OpenAI一支小团队产出了100万行生产级代码,一行手写都没有——全部由AI Agent完成。人类设计的,是让Agent可靠运转的那套系统,现在有了名字:Harness Engineering。几周内,Anthropic连发3篇论文,ThoughtWorks整理出框架,Hugging Face的Philipp Schmid直接称其为“2026年最重要的学科”。

什么是Harness?Agent = Model + 缰绳

ThoughtWorks给出最简定义:Agent = Model + Harness。Harness就是模型以外的一切——约束、反馈回路、文档、工具权限。去掉Harness,模型在代码库里瞎猜;加上对的Harness,就能产出生产级代码。Philipp Schmid用电脑比喻:Model是CPU,Context Window是RAM,Harness就是操作系统,管理CPU看到什么、什么时候看到。大多数人跑Agent等于“没有操���系统”,一上线就崩。

LangChain在Terminal Bench 2.0上测试:旧Harness得分52.8%,新Harness66.5%,同一模型,差13.7个百分点。Vercel反向操作——砍掉Agent 80%的工具,效果反而更好。

5个核心产物:从文件到冲锋契约

1. AGENT.md / CLAUDE.md / .cursorrules ——散布在代码库各处的Markdown文件,Agent每次会话开头读取,像新工程师的入职文档。没有它,Agent每次都是盲开机。

2. JSON Feature List ——进度追踪器。每项记录:功能、验证方法、Pass/Fail状态。Anthropic发现Agent无意覆盖JSON的概率比Markdown低,细节关键但影响巨大。

3. Session初始化常规 ——Anthropic的7步开机:确认目录→读git log与进度→抓最高优先级未完成项→启动开发服务器→跑基础E2E验证→实现一个功能→提交更新。每次一致,Agent立刻进入工作状态。

4. Sprint Contract(冲锋契约) ——写代码前,两个Agent先谈判:Generator提案做什么、怎么验证成功;Evaluator审查。双方同意才开工。同一轮内既规划又执行的Agent,输出不可靠。

5. Structured Task Template(结构化任务模板) ——写代码前���Harness先分析真实代码库,产出接地的影响地图(真实文件路径、真实符号名、既有模式、验收标准),然后再动手。跳过的团队,Agent会发明不存在的API。

3大学派:环境、分离、框架

OpenAI学派(环境优先):设计环境到极致,然后放Agent跑。Sora Android应用:4个工程师28天完成,Play Store排名第一,99.9%无崩溃。Codex每周处理内部70%的PR。哲学:设计环境,然后放Agent去跑。

Anthropic学派(把做和审分离):自评不行,Agent会给自己打全A。解法:三个专职Agent——Planner把2句话提示变成完整规格,Generator一次一个sprint实现,Evaluator用浏览器自动化测试。A/B测试:单Agent无Harness成本$9/20分钟产出坏掉的应用;完整Harness成本$200/6小时产出可运行软件+精致UI。

ThoughtWorks学派(2×2框架):基于50+团队失败模式,将每个Harness控制分为两个轴:时间(Feedforward指引 vs Feedback反馈)和方式(Computational确定性 vs Inferential LLM型)。形成2×2矩阵:Type System/Linter(Computational+Feedforward)、Test Suite/CI(Computational+Feedback)、Spec文档/约束描述(Inferential+Feedforward)、LLM Code Reviewer(Inferential+Feedback���。强调Feedforward和Feedback必须同时存在。

5条普世原则

Context胜过Instruction——给Agent当前世界的状态地图,比抽象指令更有效。接地在真实文件路径,输出适配代码库;含糊描述导致幻觉路径。

规划与执行必须分离——同一轮里既规划又执行不可靠。规划这一步不一定要人做,但必须是分开的一步,输出被审核后才能开工。

Feedback回路不可妥协——OpenAI用CI/CD,Anthropic用另一个LLM,ThoughtWorks两者叠加。没有Feedback的Harness只是带步骤的提示词。

一次只做一件事——强制造渐主义。Anthropic常规:读进度→挑一个功能→实现→提交→重复。想一次做太多的Agent会耗尽上下文、失去连贯性、安静地丢掉需求。

代码库本身就是文档——AGENT.md、Feature List、Git历史就是Agent的连续性机制。如果约定不在代码库里,Agent就不会知道。脏仓库加AI等于规模化混乱。

Harness衰退:为删除而建

Anthropic从Opus 4.5升到4.6时,sprint拆解组件变多余;4.7模型开始自行验证输出,Evaluator角色缩水。模型进步让Harness组件隐含的假设过期,变成纯开销。Philipp Schmid建议:Build to delete——设计每个组件时可移除,定期关掉测试是否还有用。Manus半年重构Harness 5次,LangChain一年重整3次,Vercel砍掉80%工具后表现变好。

成本现实:Anthropic A/B测试中,单Agent无Harness成本$9,完整Harness $200——22倍成本换来真正能跑的产品。但Harness+模型组合会进化:更好模型=更简单Harness=更便宜的单次运行=更快输出。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。