2026年1月,AI大神Andrej Karpathy在X上发帖批评Claude写代码的方式:默认假设、过度设计、误伤无关代码。Forrest Chang将痛点浓缩成4条行为规则,放进CLAUDE.md文件,上线即爆红,获12万Star。但几个月后,Claude Code生态从单次补全进化到多步骤Agent协作,旧规则开始失灵。一位开发者在6周内测试30个代码库,揭露原版模板在4个关键场景默默失效,并补上8条新规则,将错误率从41%压到3%。
Karpathy的4条基础规则
规则1:编码前先思考。不要默默假设,要说明假设并暴露权衡点。规则2:简单优先。用最少代码解决问题,不添加想象中的功能。规则3:外科手术式修改。只改必须改的部分,不乱优化相邻代码。规则4:以目标为导向执行。先��义成功标准,循环迭代直到验证。这4条规则能解决约40%的失败模式。
新战场:Agent冲突、hook连锁、跨session中断
原模板未覆盖的场景逐一浮现:模型开始决定本应由确定性代码处理的问题(如重试API),导致每周判断不一致;无预算约束的Claude Code会话可能变成50K token的上下文倾倒;代码库中两套矛盾模式并存时,Claude会写出“平均代码”;在多步骤任务中,一步出错后模型继续在错误状态上操作。开发者针对这些场景补充了8条规则,包括:将非AI任务交给确定性代码、设定单任务4K token预算、在矛盾模式中选择优先模式并标记另一套、修改前先读取相邻代码的导出内容等。
规则5-8:预算上限、模式统一、测试真逻辑
新增规则覆盖了原模板的空白。例如:添加“在文件中增加代码前,先读取该文件的导出内容、直接调用方及共享工具函数”,防止函数重复;要求每个测试编码“为什么这个行为重要”而非仅验证返回值,避免测试通过但逻辑错误;在多步骤任务中每完成一步就总结状态,防止连锁偏离。测试显示,加入8条新规则后,错误率从41%降至3%,遵守率仅从78%微降至76%,新增规则��未争夺注意力预算。
原模板4个失效场景
第一,长时间运行的Agent任务:原模板没有预算规则和检查点规则,pipeline会慢慢漂移。第二,多代码库一致性:原始规则只匹配一种风格,但在monorepo中Claude随机选择或混合多种风格。第三,测试质量:原规则视“测试通过”为成功,但Claude可能写出只验证常量的测试。第四,生产与原型差异:简单的规则在早期探索阶段容易过度触发,拖慢原型开发。新增规则正是针对这些漏洞。
开发者强调,CLAUDE.md不应超过200行,否则遵守率明显下降。建议将Karpathy的4条基础规则追加到现有CLAUDE.md,再粘贴规则5-12。每一规则都应回答“它能防止什么错误”——针对真实失败模式定制的6条规则,胜过12条中6条永远用不上的版本。

