Skild AI 发布了新的机器人基础模型 S1,重点放在上下文学习(in-context learning,ICL)上。按照官方介绍,S1 不需要在后训练阶段为新操作单独补数据,也不需要改动模型权重,只要观看一段人类示范视频,就能完成一整套此前未见过的复杂操作。

在官方演示中,机器人完成了煎饼、冲泡咖啡、给植物换盆和设备组装等长程任务。Skild AI 给出的数据称,在未见过的任务上,S1 的成功率达到 66%,而基于语言提示的 VLA 为 9%。如果采用传统后训练微调路线,要追平 S1 只看一次演示后的效果,大约需要约 380 次任务演示。
文章提到,自上周 Generalist 发布能够学习 3 秒到 12 秒动作的具身模型 Gen 1.5 之后,Skild AI 这次把机器人上下文学习的任务长度拉到了 10 分钟以上。部分社交平台用户据此认为,通用机器人出现的时间可能会早于此前一些判断;也有人把 Rhoda、Generalist 和这次的 Skild S1 连在一起,认为机器人领域正在接近类似大模型的「GPT 时刻」。
Skild 把机器人学习路径类比为从 BERT 走向 GPT
Skild AI 在技术博客中,把传统机器人学习新技能的方式概括为两段式流程:先用大量数据做预训练,再在具体场景里围绕某个任务收集数据,通过后训练让机器人掌握专门技能。

问题在于,机器人与大模型虽然流程相似,数据成本却差异很大。大模型的预训练数据大量来自互联网,到了编程、Agent 等垂直场景,很多后训练数据也可以在线快速获取,甚至自动生成。机器人则不同,无论预训练数据还是后训练数据,都需要在现实世界里采集。
Skild AI 由此提出一个问题:如果一个机器人基础模型在学习每个新任务时,仍然需要几十小时甚至几百小时真机数据,再重新做后训练,那么这个「基础模型」的基础能力到底体现在哪里。文章还引用既有研究称,当针对某个新任务已经拥有足够多的数据时,从零训练的模型甚至可能追平经历过预训练再微调的基础模型。
Skild 的回答是,把重点从后训练转向上下文学习。公司认为,早期的 BERT 已经具备很强能力,但面对新任务通常还要重新准备数据并微调;真正改变范式的是 GPT-3 之后逐步显现的上下文学习能力,即不修改模型权重,只在 Prompt 中给出几个例子,模型就能临时学会一项新任务。Skild 认为,机器人今天仍更像处在类似 BERT 的阶段,而他们想推动的,是让机器人完成同样的范式转换。
S1 的上下文学习,指向新技能和长任务组合
Skild 认为,检验机器人上下文学习能力,主要看两个维度。

- 能不能学会训练中从未见过的新技能;
- 能不能把已有技能重新组合,完成一个很长、很复杂的新任务。
以煎饼任务为例,机器人只需要观看一段翻煎饼的视频,就能学会如何制作煎饼,即便这项技能此前并未出现在训练数据中。相较于上周 Gen 1.5 展示的秒级视频,S1 这次把上下文学习推到了最长 10 分钟。
在植物换盆等任务里,每个任务都要连续完成几十个操作步骤。按文章描述,机器人不仅要模仿视频动作,还要知道当前进行到哪一步、下一步该做什么、不同技能如何衔接、某一步失败后如何继续执行。这意味着它需要理解演示视频中的任务意图和动作关系,而不是只做简单的行为克隆。
在植物换盆任务中,从开始录制演示到机器人自己执行,整个过程只用了 11 分钟。Skild 还强调,S1 在整个过程中没有使用 fine-tuning,也没有进行 post-training,模型权重保持不变,用同一套权重完成了博客中展示的所有任务。文章将这一点类比为大模型从需要针对特定场景微调的 BERT,跨越到只看演示就能完成分布外任务的 GPT-3 式能力。区别在于,这里的 Prompt 不是语言,而是动作视频。
实验结果:数据规模变大后,视频 ICL 开始反超语言提示
在实验部分,Skild 先比较了 ICL 视频 Prompt 与传统语言 Prompt VLA 在训练中见过任务和未见过任务上的表现。

结果显示,当训练数据只有 1000 小时时,语言 Prompt 的效果更好;随着数据规模扩大,ICL 开始反超。到 10 万小时时,在训练中见过的任务上,ICL 成功率为 96%,语言 Prompt 为 89%。而在更关键的分布外任务上,ICL 为 66%,语言 Prompt 只有 9%。
Skild 还在不同实验条件下测试 S1 的泛化性。结果显示,语言 Prompt VLA 的性能下降幅度最高达到 ICL 的 3 倍。按照文章的解释,这意味着 ICL 学到的并非固定场景里的动作重复,而是更接近根据当前环境重新规划执行方式。
在 one-shot learning 方面,S1 在新任务上完全不做 post-training,只看一条视频演示,成功率就达到 66%。相比之下,传统 VLA 大概要经过约 380 次演示后的训练,才能追到同样水平。若把演示次数继续增加到 2000 次,传统 post-training 最终可以做到 86%。文章给出的判断不是「以后机器人不用训练了」,而是学习一个新技能的门槛可能从过去的「教几百遍」,下降到「先看一遍,就能先做到六七十分」。
Skild 所说的 ICL scaling law
文章把这一趋势概括为 ICL scaling law:数据越多,模型得到的不只是更多技能,还会越来越擅长从演示中学习新技能。围绕这一点,作者认为现在值得关注的问题,已经不只是机器人还能否掌握更多技能,而是学习一个新技能的成本,能不能从「教几百遍」真正变成「你做一遍,它看一遍」。

Skild AI 背后的团队与融资情况
Skild 成立于 2023 年,核心人物是 Deepak Pathak 和 Abhinav Gupta。两人都是卡内基梅隆大学机器人研究所教授。文章介绍称,Deepak Pathak 主要研究机器人学习、强化学习和计算机视觉,Abhinav Gupta 的研究方向则包括计算机视觉和自监督学习。
两人在 2022 年合作过 WHIRL,尝试让机器人通过观看人类视频进行 one-shot imitation。文章据此认为,S1 这一路线并不是突然出现,而是延续了此前的研究脉络。
融资方面,Skild 在 2024 年走出隐身模式后完成了 3 亿美元 A 轮融资,估值为 15 亿美元。到今年 1 月,公司又完成 14 亿美元 C 轮融资,估值超过 140 亿美元,由 SoftBank 领投,英伟达和贝索斯等继续参与。文章称,两年多时间里,Skild 的估值接近翻了 10 倍。
Skild 的定位:Any robot, any task, one brain
横向对比中,文章称 Skild 在北美具身智能赛道的定位较为特殊。相比于 PI 更像是在做「机器人 GPT」,Generalist 近期强调 one-shot learner,Genesis AI 和 Sunday 则展现出全栈路线势头,Skild 长期强调的是「Any robot, any task, one brain」。

也就是说,Skild 更强调跨 embodiment,希望同一个 Skild Brain 能运行在机械臂、四足机器人和人形机器人等不同形态上。文章将这一思路概括为,Skild 试图成为机器人时代的安卓:把一个智能层放进各种不同的身体里。
这一定位也决定了它的数据策略。Skild 把机器人数据分成 hardware proximity、diversity 和 scalability 三个维度:真机遥操作最接近硬件,但成本高;第一视角人类视频最容易规模化,但与机器人身体差异较大;仿真便宜、可以快速生产数据,但存在 sim-to-real gap。
因此,Skild 对 Robot Teleop、UMI、Egocentric Video 和 Simulation 基本采取「都用」的策略。文章认为,S1 的 ICL 能力正是这一路线的自然延伸。
从 LocoFormer 到 S1
按文中列出的时间线,Skild 在这条路线上的推进包括:

- 2025 年 9 月:LocoFormer;
- 2026 年 2 月:首次 In-Domain ICL;
- 2026 年 5 月:第一次翻煎饼;
- 2026 年 8 月:发布 S1,把上下文学习推进到最长 10 分钟的分布外长程任务。
文章最后认为,如果这一 scaling law 还能继续成立,那么机器人领域的「GPT moment」未必只是营销说法。
参考链接:https://www.skild.ai/blogs/s1
本文来自微信公众号「量子位」,作者:henry。

