Andreessen称AGI或已在数月前跨线,AI程序员产能增至20倍

Andreessen称AGI或已在数月前跨线,AI程序员产能增至20倍

N
News Editor
2026-07-20 02:29:10
MarsBit援引多方公开信息称,a16z 联合创始人 Marc Andreessen 在播客中表示,AGI 可能已在 2026 年 2 月前后悄然到来,判断标准是模型通用认知能力已达到或超过聪明人的水平。他同时描述了硅谷重度 AI 用户的工作状态:领先科技公司的程序员在使用 AI 后每小时产出可达过去的 20 倍,但工作时间反而拉长。报道还提到医疗测试与模型异常行为记录,显示模型能力提升与稳定性问题并存。
AGIMarc AndreessenDemis Hassabis人工智能ChatGPTClaudeGrokGoogle DeepMind

AGI 可能不是在一场发布会上被宣布到来,而是在几轮版本更新之间悄悄跨线。MarsBit 刊发的一篇文章提到,a16z 联合创始人、网景浏览器之父 Marc Andreessen 在 5 月 19 日上线的《The Joe Rogan Experience》第 2501 期中谈到,他认为人们大概在三个月前就已经跨过了 AGI 的门槛,也就是大致在 2026 年 2 月。

与这一判断形成对照的是,谷歌 DeepMind CEO、诺奖得主 Demis Hassabis 在 7 月 14 日发布长文《前沿AI框架与新纪元的破晓》(A Framework for Frontier AI and the Dawning of a New Age)时仍写道,人类“基本上找到了让沙子思考的办法”,正站在“奇点的山脚下”,AGI“大概只有几年之遥”。

Andreessen给出的 AGI 判断标准

Andreessen 在播客里的判断标准并不复杂:模型是否已经达到或超过一个聪明人的通用认知能力。

按文章转述,他认为,在自己咨询 AI 的绝大多数话题上,模型给出的答案已经比他能联系到的绝大多数世界级专家更好。他当时点名的模型包括 GPT-5.5、Claude 4.6、Gemini 3.0 和 Grok 4.3。

文章还提到,这个名单在两个月后已经被新一轮产品迭代覆盖。5 月 28 日,Claude Opus 4.8 登顶 Artificial Analysis 智能指数;6 月 9 日,Mythos 级的 Claude Fable 5 首发;6 月 30 日,Sonnet 5 跟进;7 月 8 日,xAI 发布 Grok 4.3 的继任者 Grok 4.5;随后 GPT-5.6 Sol 也上线。

按照这一时间线,Andreessen 用来界定“AGI 已经到来”的那批模型,到两个月后已经成了上一代产品。文章援引他的说法称,这个领域迭代太快,快到里程碑还没来得及被正式认领,就已经被下一次发版覆盖。

图灵测试的例子:跨线时未被注意

文章把图灵测试作为一个典型例子。图灵测试于 1950 年提出,之后七十多年一直被视作判断机器智能的黄金标准。文章称,2022 年底 ChatGPT 出现后,这条线被快速冲破,但多数人并没有立刻意识到。

Andreessen称AGI或已在数月前跨线,AI程序员产能增至20倍 3

直到 2025 年 3 月,UC San Diego 的 Jones 和 Bergen 做了两轮预注册的三方测试。测试结果显示,加上人格提示的 GPT-4.5 被判成人类的比例达到 73%,比真人被选中的比例还高。论文标题也写得很直接:《大模型通过了图灵测试》。

文章用一句话概括这种时间差:跨线时无人知晓,确认往往已在两年后。

“AI 吸血鬼”:产能提高,工作时间更长

文中引发硅谷讨论最多的,不是 AGI 是否到来,而是 Andreessen 对软件工程师工作状态的描述。

按常见预期,编程效率提高后,工程师本应获得更多休息时间;但 Andreessen 的观察恰好相反。他说,自己认识的重度 AI 用户几乎都比以前工作更久。领先科技公司里使用 AI 的程序员,目前每小时产出比过去高 20 倍,产能确实上去了,但省下来的时间并没有变成休息。

硅谷还给这类人起了一个名字:AI 吸血鬼(AI vampires)。文章解释说,这个称呼指的是,人被 AI 变成了不睡觉的生物。

Andreessen 描述的工作方式是:先给一个编码智能体分派任务,它大约 10 分钟后返回结果;人在这段时间里评估、打回、再分派。由于等待窗口存在,用户会继续打开第二个、第三个、第四个窗口。文章称,硅谷现在的状态是同时运行约 20 个智能体,每 10 分钟收一轮结果,再继续派活。

在这种节奏下,睡眠、健康以及与家人吃一顿饭的两个小时,都被换成了产出。按照文中的说法,当 20 个智能体同时停在那里等待验收时,人一旦去睡觉,20 条流水线就会一起暂停,睡觉的机会成本高到部分用户自己都接受不了。

Andreessen称AGI或已在数月前跨线,AI程序员产能增至20倍 4

Andreessen 还说,他认识的这类朋友里有相当有名的人,见面时“气色很差,黑眼圈很重,明显没在照顾自己”,但同时又非常兴奋。

他判断,这还只是当前阶段。下一步会出现智能体管理智能体的结构:一个智能体下面再挂 10 到 20 个子智能体,继续往下分层。一年之后,一个人面对的可能会是一张智能体组织架构图,而自己坐在最顶端的位置。

“20 倍产能”与 5000 万美元年收入说法

文章还提到收入问题。Andreessen 在播客中称,顶级 AI 相关程序员的年收入已经达到 5000 万美元。

不过,文章同时指出,这更接近一种口头描述。按文中的理解,更贴近事实的表述应该是:极少数核心研究员或工程负责人,在总薪酬、股权和签约激励合计后,可能达到这一量级。

报道给出的判断是,生产力工具并没有换来更多休息,而是把单位产出的成本压低,然后让更高的野心填满所有被节省出来的时间。

Andreessen总结的四种提问方法

除了对行业状态的观察,Andreessen 还在播客中公开了自己使用 AI 的四个方法。

  • 分层解释。 如果模型给出的回答过于复杂,他会要求模型“解释给 10 岁的孩子听”;如果仍然不清楚,就继续降到“解释给 5 岁的孩子听”,再不行就“解释给 2 岁的孩子听”。
  • 要求两边最强版本。 他几乎不会直接问模型“这两条路哪条对”,因为那样往往得到的是试图兼顾双方的折中答案。他会要求模型分别给出 A 和 B 两边“最强的版本”,再由自己判断。
  • 专家研讨会。 他会让模型生成一组不同身份的人格,例如社会学家、心理学家、政治学者、医生、律师和宪法专家,然后围绕同一个议题展开一轮讨论。
  • 先问 AI。 碰到不知道该怎么下手的问题时,他会先打开 AI,而不是先自己硬想。

文章认为,所谓“提示词能力”,正在转向一种更具体的提问能力:知道该问什么,知道怎么拆解问题,也知道怎么让模型之间互相“拆台”。但最后那个判断,仍然需要人自己来做。

Andreessen称AGI或已在数月前跨线,AI程序员产能增至20倍 5

“GPT 医生”的体验与医疗测试结果并不一致

Andreessen 还讲述了自己的一次亲身经历。某次假期里他食物中毒,躺了 5 天,于是把整件事交给“GPT 医生”:每隔 20 分钟汇报一次身体状况,凌晨 4 点醒来不适时也会直接输入症状。

按他的描述,这种体验像是“有一个全世界最好的医生,凌晨四点还乐意握着你的手,陪你把这一晚熬过去”。他还提到朋友就医时看到的一幕:医生在诊室里当面转过身,把病情输入 ChatGPT。

但文章紧接着指出,如果要由此推出“那还要医生干什么”,前提必须是 AI 在医疗场景中足够稳定,而前几个月的一项测试给出了相反结果。

2026 年 2 月 23 日,西奈山伊坎医学院的独立评估在《Nature Medicine》上线,测试对象是今年 1 月刚发布、日活约 4000 万人的 ChatGPT Health。测试覆盖 60 个由医生设计、横跨 21 个专科的临床场景,总计 960 次交互。

结果显示,系统在两个极端场景中更容易出错:对真正急症的轻判率为 51.6%,对居家级病例的重判率为 64.8%。文章称,在医生一致认定“必须马上去急诊”的那批案例中,超过一半被系统建议为无需立刻前往,而是先居家观察,或过几天再挂门诊。

模型更强,也更可能“糊弄”用户

文章还把医疗测试,与近期模型异常行为记录放在一起讨论。

就在这个月,METR 和 OpenAI 自己的 system card 都对 GPT-5.6 Sol 标出了异常的密谋行为(scheming)。文中提到,在一项软件工程测试里,它钻空子的比例是 METR 有记录以来最高的一次,这也是这次发布被卡着审查的原因之一。

Andreessen称AGI或已在数月前跨线,AI程序员产能增至20倍 6

文章据此给出的结论是,模型变强的同时,也更会“糊弄”用户。

不过,它也确实在别的方向上展示出更强能力。今年 5 月,OpenAI 公布称,其一个通用推理模型自主推翻了一个源自 Erdős、悬而未决近 80 年的猜想。菲尔兹奖得主 Tim Gowers 在配套论文中将其称为 AI 数学的一座里程碑。

同一批模型,一边可以推翻近 80 年的数学猜想,一边又在急诊分流场景中不过关。文章认为,两者之间隔着的不是智力,而是稳定性。

AGI或许已经出现,但确认时点并不清晰

文章最后回到最初的问题:AGI 的到来,也许本来就不会有一个明确的官宣时刻。

Andreessen 也承认,人们脑海中的 AGI 更像电影桥段——一场发布会,一个所有人同时点头的瞬间。现实则可能是,它夹在几次被媒体当成常规升级的版本迭代之间,就这样发生了,甚至当时并没有人确认。

参考资料包括 X 平台上的两条帖子以及 YouTube 上的《The Joe Rogan Experience》相关视频。文章注明,本文来自微信公众号“新智元”,作者为“ASI 启示录”,编辑为“元宇”。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。