Generalist AI 发布 GEN-1.5,机器人“看一遍就会做”引发硅谷关注

Generalist AI 发布 GEN-1.5,机器人“看一遍就会做”引发硅谷关注

N
News Editor
2026-08-21 13:23:13
Generalist AI 发布机器人基础模型 GEN-1.5,称机器人只需观看 3 到 12 秒动作演示、无需训练或微调,即可当场执行任务,在 10 个操作任务中的 one-shot 平均成功率为 59%,few-shot 平均成功率为 83%。该公司两个月前完成 4 亿美元融资,李飞飞、林斌、袁征等以个人或天使投资人身份参与,英伟达也是股东。研究者将这次发布与 2020 年 GPT-3 的节点相提并论,但相关结果目前均由 Generalist AI 自行报告,尚未经过独立验证。

8 月 19 日,宇树科技在科创板敲钟上市,开盘报 1100 元/股,市值约 4449 亿元。

同一天,英伟达 CEO 黄仁勋的女儿黄敏珊飞抵北京,现身 WRC 世界机器人大会。到了第二天北京时间凌晨,硅谷机器人公司 Generalist AI 发布新一代基础模型 GEN-1.5。

两个月前,斯坦福教授李飞飞刚以个人身份参与了 Generalist AI 的 4 亿美元融资。同轮天使投资人还包括小米联合创始人林斌和 Zoom 创始人袁征,英伟达也是股东。

GEN-1.5 给出了这些投资背后的技术理由。按照 Generalist AI 的说法,给机器人看一段 3 到 12 秒的动作演示,不训练、不微调,就能当场执行任务;在 10 个操作任务中,平均成功率达到 59%。

文中将这一变化与过去的机器人训练方式进行了对照:此前如果要教机器人拧瓶盖,工程师往往需要编程三个月;现在所需投入只是一段 3 秒钟的演示,以及 0 行代码。多位研究者把这一节点类比为 2020 年 GPT-3 发布时刻,认为具身智能走到了自己的「GPT-3 时刻」。

预训练中出现未被显式教过的策略

GEN-1.5 最受关注的能力不只是模仿,而是即兴发挥。

Generalist AI 做了一个实验:研究人员用 5 分钟的人类演示数据、只进行 1 个梯度步骤的微调,教机器人用刷子把积木扫进碗里,随后再替换工具。

当工具换成一根香蕉时,机器人把香蕉当成刷子,横向扫动积木并将其送入碗中。Generalist AI 认为,这并不奇怪,因为香蕉的形状和接触策略与刷子类似。

Generalist AI 发布 GEN-1.5,机器人“看一遍就会做”引发硅谷关注 3

但当工具换成簸箕时,模型没有继续沿用「扫」的策略,而是改用另一只手把积木推上簸箕,再抬起簸箕把积木倒进碗里。

「扫」与「铲起来再倒」是两套不同的接触序列。Generalist AI 表示,这组动作并未出现在训练数据中。公司还用最近邻语言搜索在约 189 万段预训练场景中检索,也没有找到类似的簸箕用法。

换句话说,没有人在任何阶段直接教模型这样做。

类似的即兴行为在测试中多次出现。比如,碗被一张纸盖住时,模型会先掀开纸再放积木,有时还会把纸盖回去,但训练数据里没有这个场景;一块乐高积木粘在机械手指尖上时,模型会用另一只手把它拨下来;训练数据只演示了用一只手旋转罐盖,模型在部分尝试中会自发切换到双手操作,采用完全不同的抓取和旋转策略;一个只被训练为把一块积木放进一个碗里的模型,开始自发按颜色分拣多块积木。

Generalist AI 将这些能力的共同来源归因于大规模预训练。

连续 8 个月预训练,验证集曲线尚未收敛

根据披露信息,GEN-1.5 已连续预训练超过 8 个月,经历了 3 个训练阶段。

Generalist AI 公布的验证集曲线显示,模型的「下一步动作预测误差」持续下降,至今没有出现收敛迹象。按照大语言模型领域的表述,这对应具身智能的 Scaling Law,也就是随着物理交互数据规模扩大、训练时间拉长,模型的泛化能力继续增强。

文中还提到一个反直觉发现:微调的梯度步骤越少,模型的即兴发挥能力越强。

Generalist AI 发布 GEN-1.5,机器人“看一遍就会做”引发硅谷关注 4

Generalist AI 的解释是,轻度微调会让模型更接近预训练期间积累的广泛行为库,从而保留更多可调用的「物理经验」。10 个梯度步骤只改变了模型参数的 0.15%。按照该公司的说法,这已经接近于「提醒模型一些它几乎已经知道的事情」。

GEN-1.5 还跨过了机器人领域长期存在的两道鸿沟。其一,在模拟器中录制一段演示,尽管预训练数据中不包含任何仿真数据,把这段演示放入上下文窗口后,真实机器人可以直接执行任务,并泛化到不同机械手和新的物体位置。其二,在部分测试中,人类直接用自己的双手在机器人摄像头前演示动作,机器人随后用机械手复现任务。

Generalist AI 表示,这些能力都不是刻意设计出来的结果:没有专门促进上下文学习的架构改动,没有元学习循环,也没有鼓励即兴发挥的辅助训练目标。这些能力是在大规模物理数据预训练过程中自行出现的。

从 one-shot 到 few-shot,59% 与 83% 两组数字

文中把 GEN-1.5 放在 GPT-3 的时间坐标上对照。2020 年 6 月,OpenAI 发布 GPT-3。这个模型的重要变化在于,不需要重新训练,只要在对话框里给出几个例子,就能完成新的语言任务,这种能力被称为 in-context learning,即上下文学习。

GEN-1.5 将这一机制带入了物理世界。Generalist AI 将其称为 Physical Prompting。

具体做法是,把一段真实动作演示——其中包含传感器数据和动作轨迹——放入模型的 30 秒上下文记忆窗口,其余空间用于接收实时环境观测。模型随即执行,中间没有任何训练步骤。

这里涉及一个关键概念:梯度步骤。传统机器人学习新任务时,往往需要数万步梯度下降,每一步都会对模型内部参数进行微调,过程既消耗数据,也消耗算力。GEN-1.5 的 one-shot 模式则直接跳过全部梯度步骤,模型参数保持不变。

Generalist AI 在 10 个不同操作任务上测试了 GEN-1.5,分别包括:

Generalist AI 发布 GEN-1.5,机器人“看一遍就会做”引发硅谷关注 5

  • 拧开玻璃罐盖
  • 拉开笔袋拉链
  • 从钱包里取钱
  • 叠纸
  • 叠杯子
  • 翻手机
  • 用刷子扫积木
  • 打开书本封面
  • 撕开真空垫
  • 清扫垃圾

结果分成两组:

  • one-shot:只看一遍、0 个梯度步骤,10 个任务平均成功率 59%,标准差为 ±10%
  • few-shot:使用 5 分钟数据、约 50 次演示、10 个梯度步骤,平均成功率 83%,标准差为 ±9%

文中还拿 2020 年 GPT-3 在语言任务上的表现作对照:one-shot 约为 45%,few-shot 约为 65%,对应约 100 个例子。原文认为,两组数字的结构高度相似。

其含义在于,在大语言模型出现前,让 AI 完成一个新的语言任务通常需要重新采集数据并训练新模型,周期以月计算;GPT-3 出现后,这件事可以压缩成在输入框里写下几个例子,时间从数月缩短到数秒。按照原文的判断,GEN-1.5 在物理操作领域做了类似的压缩:过去教机器人拧瓶盖,需要工程师编程数月或投入数万条训练数据反复调参,现在只需一段 3 到 12 秒的演示。

Generalist AI 在官方博客中写道,这改变了两件事:一是机器人变得有用的速度,从数月变成数秒;二是谁能使用机器人,从专家扩展到任何人。

发布时点落在机器人行业高密度一周

GEN-1.5 的发布时间,正好落在具身智能行业活动高度集中的一周。

8 月 19 日,WRC 世界机器人大会在北京亦庄开幕,300 余家企业、超过 2000 件展品、150 余款全球首发新品集中亮相。

8 月 22 日,第二届世界人形机器人运动会将在国家速滑馆「冰丝带」开赛。共有 666 支队伍携 2056 台机器人参加 51 个项目的 1301 场比赛,队伍数量较首届增长 138%。本届运动会首次设置 21 个场景赛项,要求人形机器人在工厂、酒店、家庭服务等真实环境中完成长程任务,「上岗实测」成为主题。

同样在这一周,刚刚上市的宇树科技披露,2025 年人形机器人出货量超过 5500 台,位居全球第一,营收 17 亿元,毛利率 60%。DeepSeek 也参与了其战略配售。

Generalist AI 发布 GEN-1.5,机器人“看一遍就会做”引发硅谷关注 6

不过,宇树招股书中也出现了一组反差明显的数据:2026 年一季度营收增速从上年同期的 332.64% 回落至 68.49%,扣非后净利润同比下降 52.55%。原文称,增速放缓的核心原因是研发投入大幅增加。

按照原文分析,宇树正在补足它尚未拥有的能力,即具身智能大模型。文中援引「新立场Pro」此前的一篇分析称,宇树面临的结构性困境在于,虽然做出了全球出货量第一的机器人躯体,但「大脑缺席」。

原文还提到,2026 年被称为具身智能的「上市大年」,超过 20 家公司明确了上市计划,但上市潮很大程度上也受到资金压力驱动。大量竞争对手依赖一轮接一轮融资维持运转,研发节奏受到融资窗口影响。

宇树创始人王兴兴在 WRC 上公开表示,限制人形机器人发展的主要瓶颈是具身智能大模型,「预计未来快则两到三年,慢则五到十年,有望实现机器人的 ChatGPT 时刻」。

原文认为,GEN-1.5 的发布可被视为对这一判断的首个实证回应:Scaling Law 在具身智能领域存在,大规模预训练能够让新任务适配的边际成本趋近于零。对宇树这类躯体厂商来说,一旦通用大模型成熟,躯体层的价值将取决于其接入这颗「大脑」的速度,而不只是硬件参数和出货规模。

团队背景、融资与新一轮估值谈判

Generalist AI 的团队背景与这一路线高度一致。联合创始人 Pete Florence 和 Andy Zeng 来自谷歌 DeepMind 机器人团队,Andrew Barry 来自波士顿动力。

融资方面,公司于 2026 年 6 月完成 4 亿美元融资,由 Radical Ventures 领投,英伟达和 Bezos Expeditions 参投,投后估值为 20 亿美元。

原文称,Generalist AI 目前正在以 30 亿美元估值洽谈新一轮融资。

Generalist AI 发布 GEN-1.5,机器人“看一遍就会做”引发硅谷关注 7

研究社区反应强烈,但也有保留意见

这次发布在机器人研究社区引发了明显反响。

联合创始人 Pete Florence 在 X 上写道:「自从开始研究机器人基础模型以来,广泛的 one-shot 上下文学习一直是我心中最清晰的目标。现在我看到了将近十年的想象走进现实世界。」

Florence 还提到,他和 Andy Zeng 在研究生阶段就讨论过一种「Ctrl-C-Ctrl-V」式能力:机器人看到一个动作,就能复制这个动作。但真正难点在于,「你想粘贴的那个世界,和你复制的那个世界永远不一样」。

卡内基梅隆大学机器人研究者 Chris Paxton 在 X 上称,GEN-1.5「可能是真正的 GPT 时刻」,并写道:「操作学习的圣杯,毫无疑问,就是 one-shot learning。」

美国东北大学具身智能研究者 Jimmy Yang 转发时表示:「作为具身 AI 研究者,这对这个领域来说是一个真正特别的时刻。」

英伟达机器人技术总监 Jim Fan 则从技术细节给出观察。他指出,GEN-1.5 的涌现能力可能与两个因素有关。

第一,训练数据中天然存在对称、重复的动作模式。比如组装家具时反复拧螺丝,第二颗螺丝本身就构成了第一颗螺丝的「上下文学习样本」。

第二,数据中包含人类失误后的恢复动作。物体掉落后再捡起来继续,这种「失败—恢复—继续」的完整轨迹,让模型在测试时自然表现出纠错能力。

Generalist AI 发布 GEN-1.5,机器人“看一遍就会做”引发硅谷关注 8

Jim Fan 还指出,Generalist AI 使用的 UMI 数据采集方式,即人直接戴着机器人夹爪操作,能够保留人类的「物理直觉」;而传统经过 VR 设备中转的遥操作方式,会让这类直觉大量流失。

不过,保留意见同样存在。Jim Fan 在同一条推文的评论区写道:「演示目前仍然有点太简单了,还不能下结论。」

原文也明确提到,其他研究团队此前已经展示过类似的上下文学习能力,但通常只覆盖少数任务类型;GEN-1.5 的新意在于覆盖面更广。与此同时,当前所有结果均由 Generalist AI 自行报告,尚未经过独立验证。任务本身也仍是拧瓶盖、拉拉链等短程简单操作,与真实场景中的长程复杂任务之间仍有较大距离。

原文最后将 GEN-1.5 与 2020 年 6 月发布的 GPT-3 作了位置类比:从 GPT-3 到 ChatGPT,中间经历了两年半;而 GEN-1.5 当前所处的位置,与当年的 GPT-3 相似——能力仍显粗糙,但方向已经明确;任务还较简单,但 Scaling 趋势已经显现。

Generalist AI 在官方博客中写道,跨过某个预训练阈值后,适配一个新任务的成本会变得几乎可以忽略不计。涌现出的上下文学习、几秒钟的数据,或者一个梯度步骤加一分钟演示,已经不再是传统意义上的任务特定训练,而更接近于提醒模型一些它几乎已经知道的事情。

如果具身智能的 Scaling 曲线确实仍未出现收敛迹象——按照 Generalist AI 的说法,他们目前还没有看到——那么下一轮竞争的核心资源,就会变成谁能掌握足够多的物理交互数据来驱动这套系统。这一点,被原文比作 2021 年大语言模型进入数据争夺阶段时的情形。

本文来自微信公众号「新智元」,作者为「ASI启示录」。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
20

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。