Andrej Karpathy近日在一场面向Agent开发者的分享中表示,当前AI行业最大的错误之一,是过早逼迫Agent执行复杂任务,却没有先把底层大模型能力研究清楚。这段发言随后在X平台广泛传播,引发开发者社区对Agent研发路径的讨论。

Karpathy回顾2016年World of Bits项目失利
Karpathy提到,早在2016年,他在OpenAI与Tianlin Shi、Jim Fan等人推进名为World of Bits的项目,目标是训练Agent通过键盘和鼠标完成网页操作,例如订机票、点外卖等任务。相关研究随后形成论文《World of Bits: An Open-Domain Platform for Web-Based Agents》,并发表于ICML 2017。
不过,Karpathy直言该项目并未真正取得预期成果。按他的复盘,当时团队手中的主要工具仍是强化学习,技术栈并不足以支撑开放环境下的网页智能体。回头看,他认为彼时更合理的路线并不是继续推动Agent落地,而是把重点转向语言模型等更底层的能力建设。

他还提到,如今Agent研发所依赖的工具箱与当年已大不相同,开发者几乎不再沿用彼时的强化学习范式。值得注意的是,当年参与该项目的Jim Fan如今已成为NVIDIA高级研究科学家,并主导了Voyager、MineDojo等项目,在Agent方向持续推进。这也反映出,行业虽然仍在做Agent,但所走路径已经明显不同于2016年。
“Demo容易,产品要十年”
结合自身经历,Karpathy给出了三点判断。第一,开发者不应继续要求Agent“什么都干”,而应优先把底层模型做对。他提到,自己在2026年5月加入Anthropic预训练团队后,就公开表示未来几年LLM前沿工作依然至关重要。这一选择本身,也被外界视为其对Agent热潮的明确态度。

第二,Karpathy认为Agent极易做出Demo,但做成产品往往需要十年。他以自动驾驶和VR为例称,前者让车辆完成短距离演示并不难,但真正走向商业化产品用了整整十年;VR领域同样长期存在惊艳演示,却经历了漫长落地周期。在他看来,Agent也属于这一类技术:想象空间很大,演示门槛不高,但产品化极难。
第三,他强调,真正有价值的不是“Agent产品”这一外壳,而是底层基础能力。只要地基足够稳固,Agent形态会自然出现;反之,如果在模型能力不足时强行叠加Agent外层应用,越快推进,风险反而越高。Karpathy的核心判断是,Agent无法绕过自动驾驶等行业已经验证过的长期工程规律。
建议从神经科学寻找智能机制线索
在谈到未来方向时,Karpathy将话题转向神经科学。他提出,一些关键问题仍缺乏清晰答案,例如Agent体系中什么模块对应海马体的记忆、索引与检索功能,什么部分类似基底神经节负责行为选择与执行,又有哪些结构接近丘脑所承担的信息协调作用。

他在现场推荐了David Eagleman的《Brain and Behavior: A Cognitive Neuroscience Perspective》,认为构建数字智能系统时,行业需要重新面对“智能究竟是什么”这一基础问题。按照他的说法,早期深度学习曾从单个神经元结构中获得启发,而今天的Agent研究,也可能再次从大脑机制中借鉴关键思路。
Karpathy称Agent前沿未被大厂垄断
虽然前半段发言被视为给行业“泼冷水”,但Karpathy在结尾向独立开发者和创业者释放了相对积极的信号。他表示,在Agent能力的最前沿,未必是OpenAI或DeepMind这样的大型机构,很多真正站在边界上的,反而是创业团队和个人开发者。

他的理由是,大厂在Transformer和大规模语言模型训练上已经积累多年,对许多训练方法、失败路径和工程细节都非常熟悉;但在Agent方向,尚不存在某一家机构拥有五年以上的压倒性先发优势。也就是说,相比大模型训练这条成熟赛道,Agent仍处在一片新大陆,灵活试错、快速迭代的独立开发者并未天然落后。
Karpathy因此强调,他并不是反对做Agent,而是反对跳过基础能力直接做Agent产品。对一线开发者而言,这场竞赛仍然开放,但前提是愿意把时间投入到底层模型、长期工程化和智能本质的研究中,而不是停留在短周期的炫酷演示之上。

