8 月 19 日,宇树科技在科创板敲钟上市,开盘报 1100 元/股,市值约 4449 亿元。
同一天,英伟达 CEO 黄仁勋的女儿黄敏珊飞抵北京,现身 WRC 世界机器人大会。到了第二天北京时间凌晨,硅谷机器人公司 Generalist AI 发布新一代基础模型 GEN-1.5。
两个月前,斯坦福教授李飞飞刚以个人身份参与了 Generalist AI 的 4 亿美元融资。同轮天使投资人还包括小米联合创始人林斌和 Zoom 创始人袁征,英伟达也是股东。
GEN-1.5 给出了这些投资背后的技术理由。按照 Generalist AI 的说法,给机器人看一段 3 到 12 秒的动作演示,不训练、不微调,就能当场执行任务;在 10 个操作任务中,平均成功率达到 59%。
文中将这一变化与过去的机器人训练方式进行了对照:此前如果要教机器人拧瓶盖,工程师往往需要编程三个月;现在所需投入只是一段 3 秒钟的演示,以及 0 行代码。多位研究者把这一节点类比为 2020 年 GPT-3 发布时刻,认为具身智能走到了自己的「GPT-3 时刻」。
预训练中出现未被显式教过的策略
GEN-1.5 最受关注的能力不只是模仿,而是即兴发挥。
Generalist AI 做了一个实验:研究人员用 5 分钟的人类演示数据、只进行 1 个梯度步骤的微调,教机器人用刷子把积木扫进碗里,随后再替换工具。
当工具换成一根香蕉时,机器人把香蕉当成刷子,横向扫动积木并将其送入碗中。Generalist AI 认为,这并不奇怪,因为香蕉的形状和接触策略与刷子类似。

但当工具换成簸箕时,模型没有继续沿用「扫」的策略,而是改用另一只手把积木推上簸箕,再抬起簸箕把积木倒进碗里。
「扫」与「铲起来再倒」是两套不同的接触序列。Generalist AI 表示,这组动作并未出现在训练数据中。公司还用最近邻语言搜索在约 189 万段预训练场景中检索,也没有找到类似的簸箕用法。
换句话说,没有人在任何阶段直接教模型这样做。
类似的即兴行为在测试中多次出现。比如,碗被一张纸盖住时,模型会先掀开纸再放积木,有时还会把纸盖回去,但训练数据里没有这个场景;一块乐高积木粘在机械手指尖上时,模型会用另一只手把它拨下来;训练数据只演示了用一只手旋转罐盖,模型在部分尝试中会自发切换到双手操作,采用完全不同的抓取和旋转策略;一个只被训练为把一块积木放进一个碗里的模型,开始自发按颜色分拣多块积木。
Generalist AI 将这些能力的共同来源归因于大规模预训练。
连续 8 个月预训练,验证集曲线尚未收敛
根据披露信息,GEN-1.5 已连续预训练超过 8 个月,经历了 3 个训练阶段。
Generalist AI 公布的验证集曲线显示,模型的「下一步动作预测误差」持续下降,至今没有出现收敛迹象。按照大语言模型领域的表述,这对应具身智能的 Scaling Law,也就是随着物理交互数据规模扩大、训练时间拉长,模型的泛化能力继续增强。
文中还提到一个反直觉发现:微调的梯度步骤越少,模型的即兴发挥能力越强。

Generalist AI 的解释是,轻度微调会让模型更接近预训练期间积累的广泛行为库,从而保留更多可调用的「物理经验」。10 个梯度步骤只改变了模型参数的 0.15%。按照该公司的说法,这已经接近于「提醒模型一些它几乎已经知道的事情」。
GEN-1.5 还跨过了机器人领域长期存在的两道鸿沟。其一,在模拟器中录制一段演示,尽管预训练数据中不包含任何仿真数据,把这段演示放入上下文窗口后,真实机器人可以直接执行任务,并泛化到不同机械手和新的物体位置。其二,在部分测试中,人类直接用自己的双手在机器人摄像头前演示动作,机器人随后用机械手复现任务。
Generalist AI 表示,这些能力都不是刻意设计出来的结果:没有专门促进上下文学习的架构改动,没有元学习循环,也没有鼓励即兴发挥的辅助训练目标。这些能力是在大规模物理数据预训练过程中自行出现的。
从 one-shot 到 few-shot,59% 与 83% 两组数字
文中把 GEN-1.5 放在 GPT-3 的时间坐标上对照。2020 年 6 月,OpenAI 发布 GPT-3。这个模型的重要变化在于,不需要重新训练,只要在对话框里给出几个例子,就能完成新的语言任务,这种能力被称为 in-context learning,即上下文学习。
GEN-1.5 将这一机制带入了物理世界。Generalist AI 将其称为 Physical Prompting。
具体做法是,把一段真实动作演示——其中包含传感器数据和动作轨迹——放入模型的 30 秒上下文记忆窗口,其余空间用于接收实时环境观测。模型随即执行,中间没有任何训练步骤。
这里涉及一个关键概念:梯度步骤。传统机器人学习新任务时,往往需要数万步梯度下降,每一步都会对模型内部参数进行微调,过程既消耗数据,也消耗算力。GEN-1.5 的 one-shot 模式则直接跳过全部梯度步骤,模型参数保持不变。
Generalist AI 在 10 个不同操作任务上测试了 GEN-1.5,分别包括:

- 拧开玻璃罐盖
- 拉开笔袋拉链
- 从钱包里取钱
- 叠纸
- 叠杯子
- 翻手机
- 用刷子扫积木
- 打开书本封面
- 撕开真空垫
- 清扫垃圾
结果分成两组:
- one-shot:只看一遍、0 个梯度步骤,10 个任务平均成功率 59%,标准差为 ±10%
- few-shot:使用 5 分钟数据、约 50 次演示、10 个梯度步骤,平均成功率 83%,标准差为 ±9%
文中还拿 2020 年 GPT-3 在语言任务上的表现作对照:one-shot 约为 45%,few-shot 约为 65%,对应约 100 个例子。原文认为,两组数字的结构高度相似。
其含义在于,在大语言模型出现前,让 AI 完成一个新的语言任务通常需要重新采集数据并训练新模型,周期以月计算;GPT-3 出现后,这件事可以压缩成在输入框里写下几个例子,时间从数月缩短到数秒。按照原文的判断,GEN-1.5 在物理操作领域做了类似的压缩:过去教机器人拧瓶盖,需要工程师编程数月或投入数万条训练数据反复调参,现在只需一段 3 到 12 秒的演示。
Generalist AI 在官方博客中写道,这改变了两件事:一是机器人变得有用的速度,从数月变成数秒;二是谁能使用机器人,从专家扩展到任何人。
发布时点落在机器人行业高密度一周
GEN-1.5 的发布时间,正好落在具身智能行业活动高度集中的一周。
8 月 19 日,WRC 世界机器人大会在北京亦庄开幕,300 余家企业、超过 2000 件展品、150 余款全球首发新品集中亮相。
8 月 22 日,第二届世界人形机器人运动会将在国家速滑馆「冰丝带」开赛。共有 666 支队伍携 2056 台机器人参加 51 个项目的 1301 场比赛,队伍数量较首届增长 138%。本届运动会首次设置 21 个场景赛项,要求人形机器人在工厂、酒店、家庭服务等真实环境中完成长程任务,「上岗实测」成为主题。
同样在这一周,刚刚上市的宇树科技披露,2025 年人形机器人出货量超过 5500 台,位居全球第一,营收 17 亿元,毛利率 60%。DeepSeek 也参与了其战略配售。

不过,宇树招股书中也出现了一组反差明显的数据:2026 年一季度营收增速从上年同期的 332.64% 回落至 68.49%,扣非后净利润同比下降 52.55%。原文称,增速放缓的核心原因是研发投入大幅增加。
按照原文分析,宇树正在补足它尚未拥有的能力,即具身智能大模型。文中援引「新立场Pro」此前的一篇分析称,宇树面临的结构性困境在于,虽然做出了全球出货量第一的机器人躯体,但「大脑缺席」。
原文还提到,2026 年被称为具身智能的「上市大年」,超过 20 家公司明确了上市计划,但上市潮很大程度上也受到资金压力驱动。大量竞争对手依赖一轮接一轮融资维持运转,研发节奏受到融资窗口影响。
宇树创始人王兴兴在 WRC 上公开表示,限制人形机器人发展的主要瓶颈是具身智能大模型,「预计未来快则两到三年,慢则五到十年,有望实现机器人的 ChatGPT 时刻」。
原文认为,GEN-1.5 的发布可被视为对这一判断的首个实证回应:Scaling Law 在具身智能领域存在,大规模预训练能够让新任务适配的边际成本趋近于零。对宇树这类躯体厂商来说,一旦通用大模型成熟,躯体层的价值将取决于其接入这颗「大脑」的速度,而不只是硬件参数和出货规模。
团队背景、融资与新一轮估值谈判
Generalist AI 的团队背景与这一路线高度一致。联合创始人 Pete Florence 和 Andy Zeng 来自谷歌 DeepMind 机器人团队,Andrew Barry 来自波士顿动力。
融资方面,公司于 2026 年 6 月完成 4 亿美元融资,由 Radical Ventures 领投,英伟达和 Bezos Expeditions 参投,投后估值为 20 亿美元。
原文称,Generalist AI 目前正在以 30 亿美元估值洽谈新一轮融资。

研究社区反应强烈,但也有保留意见
这次发布在机器人研究社区引发了明显反响。
联合创始人 Pete Florence 在 X 上写道:「自从开始研究机器人基础模型以来,广泛的 one-shot 上下文学习一直是我心中最清晰的目标。现在我看到了将近十年的想象走进现实世界。」
Florence 还提到,他和 Andy Zeng 在研究生阶段就讨论过一种「Ctrl-C-Ctrl-V」式能力:机器人看到一个动作,就能复制这个动作。但真正难点在于,「你想粘贴的那个世界,和你复制的那个世界永远不一样」。
卡内基梅隆大学机器人研究者 Chris Paxton 在 X 上称,GEN-1.5「可能是真正的 GPT 时刻」,并写道:「操作学习的圣杯,毫无疑问,就是 one-shot learning。」
美国东北大学具身智能研究者 Jimmy Yang 转发时表示:「作为具身 AI 研究者,这对这个领域来说是一个真正特别的时刻。」
英伟达机器人技术总监 Jim Fan 则从技术细节给出观察。他指出,GEN-1.5 的涌现能力可能与两个因素有关。
第一,训练数据中天然存在对称、重复的动作模式。比如组装家具时反复拧螺丝,第二颗螺丝本身就构成了第一颗螺丝的「上下文学习样本」。
第二,数据中包含人类失误后的恢复动作。物体掉落后再捡起来继续,这种「失败—恢复—继续」的完整轨迹,让模型在测试时自然表现出纠错能力。

Jim Fan 还指出,Generalist AI 使用的 UMI 数据采集方式,即人直接戴着机器人夹爪操作,能够保留人类的「物理直觉」;而传统经过 VR 设备中转的遥操作方式,会让这类直觉大量流失。
不过,保留意见同样存在。Jim Fan 在同一条推文的评论区写道:「演示目前仍然有点太简单了,还不能下结论。」
原文也明确提到,其他研究团队此前已经展示过类似的上下文学习能力,但通常只覆盖少数任务类型;GEN-1.5 的新意在于覆盖面更广。与此同时,当前所有结果均由 Generalist AI 自行报告,尚未经过独立验证。任务本身也仍是拧瓶盖、拉拉链等短程简单操作,与真实场景中的长程复杂任务之间仍有较大距离。
原文最后将 GEN-1.5 与 2020 年 6 月发布的 GPT-3 作了位置类比:从 GPT-3 到 ChatGPT,中间经历了两年半;而 GEN-1.5 当前所处的位置,与当年的 GPT-3 相似——能力仍显粗糙,但方向已经明确;任务还较简单,但 Scaling 趋势已经显现。
Generalist AI 在官方博客中写道,跨过某个预训练阈值后,适配一个新任务的成本会变得几乎可以忽略不计。涌现出的上下文学习、几秒钟的数据,或者一个梯度步骤加一分钟演示,已经不再是传统意义上的任务特定训练,而更接近于提醒模型一些它几乎已经知道的事情。
如果具身智能的 Scaling 曲线确实仍未出现收敛迹象——按照 Generalist AI 的说法,他们目前还没有看到——那么下一轮竞争的核心资源,就会变成谁能掌握足够多的物理交互数据来驱动这套系统。这一点,被原文比作 2021 年大语言模型进入数据争夺阶段时的情形。
本文来自微信公众号「新智元」,作者为「ASI启示录」。

