Claude Fable 5自我改进系统拆解:14步搭建可连续运行代理

Claude Fable 5自我改进系统拆解:14步搭建可连续运行代理

N
News Editor 01
2026-07-24 06:10:19
CryptoComLearn刊文梳理 Anthropic 围绕 Claude Fable 5 的自我改进代理方法,核心包括循环、动态工作流、Routines 与记忆机制,并给出 14 步搭建路径。

CryptoComLearn 发布长文,围绕 Claude Fable 5 的自我改进代理系统给出一套 14 步、3 层级 的搭建方法,重点放在循环、动态工作流、Routines 和记忆机制的组合。文章指出,很多用户仍把 Fable 5 当作单次提示模型使用,但 Anthropic 为这类模型强调的是可持续运行数日的代理能力。

Fable 5的定位与成本结构

文中提到,Claude Fable 5 于 2026 年 6 月 9 日上线,被描述为首个公开可用的 Mythos 等级模型,定位高于 Opus。按照 Anthropic 披露的信息,Fable 5 支持在 Claude Code 或 Claude Managed Agents 这类代理框架中持续工作数日,能够跨阶段规划、调用子代理,并检查自身产出。

价格也对应这一定位:每百万 input token 为 10 美元,每百万 output token 为 50 美元,同时保留 prompt caching 的 90% input token 折扣。可用渠道包括 Claude API、AWS、Amazon Bedrock、Vertex AI、Microsoft Foundry,以及按使用量计费的 Enterprise 方案。

自我改进不等于模型自我学习

文章特别区分了“自我学习”和“自我改进”。前者指模型直接更新权重,文中明确表示 Fable 5 不具备这一能力;后者则是模型外部系统不断积累反馈,把经验写入状态文件、Skills 和评估规则中,让下一轮任务继承上一次的结果。模型本身无状态,运行环境却可以持续积累。

这套结构被概括为四层:底层是模型、子代理、worktrees 和工具;上一层是 /goal、Outcomes、动态工作流与 Routines 构成的编排;再往上是状态文件、Skills、知识库等记忆层;最上层则是视觉自检、评估循环和规则蒸馏组成的自我改进层。

三类关键原语:循环、工作流与云端运行

在具体实现上,文中把 /goal 与 Outcomes 视作同一类“目标驱动循环”的两种落地方式:前者更适合本地 Claude Code 中的快速可衡量任务,后者用于 Anthropic 托管环境中的长时任务。两者共同点很明确——由独立评分者判断是否达标,未达标就继续迭代。

文章还强调,验证者子代理通常优于模型自我批评。原因不是提示技巧,而是结构差异:独立验证者只看输出和评分标准,不继承原始推理路径,更容易对结果作出独立判断。

动态工作流则被介绍为 Claude Code 在 2026 年 5 月 28 日 上线的能力,允许 Claude 实时生成自己的 JavaScript harness,并组合 agent()、parallel()、pipeline() 等原语。文中点名了三种适合自我改进系统的模式:扇出并汇总、对抗式验证,以及“循环直到完成”。

Worktrees与Routines支撑多日代理

多代理并行时,文件冲突会成为实际问题。文章将 git worktree 作为并行安全的重要工具,用于把不同代理隔离在独立工作目录中,让制作者与验证者、多个结构实验或分阶段长任务彼此分离。对需要持续数日运行的代理系统,这不是附加项,而是基础设施。

Routines 则是在 2026 年 4 月 14 日 以研究预览形式推出的云端执行机制。它保存 Claude Code 的提示、仓库、连接器和权限设置,并可在 Anthropic 托管环境中按计划、API 事件或 GitHub 事件触发。文中给出的场景包括每日重跑评估集、CI 失败后自动调查、PR 合并后把新模式写回 Skill。

记忆层决定系统是否真正“复利”

文章最后把重点放在内存系。其引用 Anthropic 团队 Continual Learning Bench 1.0 的框架,将���理记忆概括为 失败、调查、验证、蒸馏、查阅 五个阶段。文中称,在一个 SQL 探索任务中,Sonnet 4.6 往往停在记录失败,Opus 4.7 可推进到部分验证,而 Fable 5 在较强执行中可把 30 题中的 22 题 完成验证,覆盖率达 73%。

支撑这套机制的核心载体是状态文件,例如 STATE.md。文中建议把已验证事实、通用规则、待调查失败、经验总结和上一次会话进度分区保存,并要求每次任务结束前先写入,下一次开始时先读取。项目记忆之外,跨项目的程序记忆则写入 Skills。文章给出的判断很直接:如果教训只停留在对话里,系统就不会持续变强。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
1200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。