李飞飞详解 World Labs 收购 SceniX:先为机器人搭建可规模化数字训练场

李飞飞详解 World Labs 收购 SceniX:先为机器人搭建可规模化数字训练场

N
News Editor
2026-08-06 08:13:13
World Labs CEO 李飞飞与 SceniX 联合创始人李昀烛在 a16z 访谈中,首次系统解释双方合作逻辑。两人表示,机器人是空间智能落地的首个试金石,SceniX 正在构建 real-to-sim-to-real 技术栈,以解决训练数据和评估数据稀缺的问题。双方目前把重点放在为机器人提供不绑定具体模型或硬件形态的数字环境基础设施,并计划从半结构化场景切入,逐步推进整合。
李飞飞World LabsSceniX机器人空间智能世界模型仿真Marble

World Labs 宣布收购 SceniX 后,World Labs CEO 李飞飞与 SceniX 联合创始人李昀烛一同做客 a16z 节目《Fei-Fei Li is Solving the Hardest Problem in Robotics》,集中谈到了双方在机器人和空间智能方向上的布局。李飞飞在访谈中表示,World Labs 的目标是把空间智能打造为 AI 的下一个前沿,而机器人则是这条路线最早、也最关键的落地场景之一。

World Labs 为何把机器人视为空间智能的首个试金石

李飞飞介绍,World Labs 是一家成立两年的初创公司,也是一家前沿模型实验室。公司当前最关注的方向,是通过构建大型世界模型走向空间智能,也就是让 AI 能在真实或虚拟空间中生成、理解、推理并交互。

她说,在空间中行动或与空间交互,并不只靠机器人实现。在 VFX、游戏和设计等创意领域,人们早已可以在虚拟空间里构建世界并进行沉浸式交互。World Labs 的长期判断是,人类所生活的世界可以成为一个多元宇宙,技术可以让用户、创作者和开发者在不同空间中行动。

不过,李飞飞同时强调,在物理空间中行动的能力,仍然是未来 AI 世界里最令人兴奋、也最具深远意义的能力之一,而机器人正处在这个方向的核心位置。她表示,World Labs 一直认为,机器人是空间智能落地的第一块试金石,也是世界建模的重要应用场景。邀请 SceniX 及其团队加入 World Labs,属于公司长期愿景和使命的一部分。

SceniX 想解决的是训练与评估数据稀缺问题

李昀烛在访谈中介绍,他是 SceniX 的联合创始人,同时担任哥伦比亚大学助理教授。他的研究起点是 MIT 博士阶段,之后曾在斯坦福跟随李飞飞做博士后。他给自己的目标定义得很直接:帮助机器人更好地感知物理世界并与之交互,让机器人真正能在现实环境中工作。

在他看来,当前通用机器人面临的瓶颈,主要集中在训练和评估环节。为此,SceniX 正在开发一条 real-to-sim-to-real 管线,把真实环境映射到与之高度对齐的数字世界。所谓“对齐”,是指数字世界里发生的事情,也应当能在真实环境中发生。这样一来,过去必须在现实中完成的数据采集和评估,就可以部分交给可规模化生成的数字环境。

李昀烛说,SceniX 团队覆盖机器人、机器人学习、仿真和渲染,希望构建一整套 real-to-sim-to-real 技术栈,解决行业最关键的训练和评估瓶颈。

李飞飞补充了一段合作起点。她说,很多人可能会以为,因为李昀烛曾是她的博士后,所以双方很早就讨论过合并,但事实并非如此。SceniX 最初是以客户身份接触 World Labs。去年冬天大约 11 月或 12 月,World Labs 发布生成模型 Marble 的第一个版本后,SceniX 第一时间注册并使用。李飞飞说,起初她甚至不知道那是李昀烛的公司,后来发现后才主动打了电话,并意识到双方有很大的合作空间。

Marble 与 SceniX 的互补关系

在李飞飞的描述中,Marble 是 World Labs 持续训练和迭代的基础模型。当前公开版本可以接收单张或多张图像、文本或这些模态的组合,并将其转化为一个几何一致的世界。她强调,这个世界看起来非常真实,而且不会出现明显穿帮。

李飞飞详解 World Labs 收购 SceniX:先为机器人搭建可规模化数字训练场 3

她把机器人数据问题与语言模型做了对比。语言模型可以从互联网上获得大量数据,但机器人没有这样的条件。她直言,SceniX 解决的正是机器人领域最困难的问题之一:训练数据和评估数据都非常匮乏。如果要让机器人真正工作,就必须释放 scaling law 的力量,而数据从哪里来,正是整个机器人行业一直在追问的问题。

谈到团队能力时,李飞飞表示,双方高度互补,也有共同使命。她提到,SceniX 的另一位技术联合创始人郑昌熙是哥伦比亚大学教授,也是仿真技术专家,拥有 VFX 背景,曾在腾讯工作,也有创业经历。胡晓晨则负责工程,曾在一家后被亚马逊收购的初创公司任职,也曾参与亚马逊多个计算机视觉技术栈项目。

在她看来,李昀烛带来了从硬件到全栈机器人的能力,郑昌熙带来了很强的仿真能力;而 SceniX 相对欠缺的,是生成模型和基于计算机视觉的三维重建能力,这部分恰好是 World Labs 的强项。双方结合后,能力版图会更完整。

李昀烛也给出了更具体的协同逻辑。他表示,SceniX 的 real-to-sim-to-real 工作需要对环境进行稠密重建,包括环境外观、几何结构和动力学,也就是施加动作后环境如何变化,而这项任务目前仍然非常重。相比之下,World Labs 在稀疏重建和生成方面积累更深。SceniX 看到了利用 Marble 以及其他相关能力提升环境重建和建模效率的机会。

是否会做机器人基础模型

在被问到 World Labs 是否会推出机器人基础模型时,李飞飞的回答是“不排除这个方向”。李昀烛则进一步解释,机器人基础模型本质上需要多模态能力,必须处理帧、文本、图像、深度以及其他模态,而动作是其中非常关键的一种模态。

他表示,如果把帧和动作一起作为输入,模型可以充当模拟器,预测执行某个动作后环境将如何变化;如果把动作作为输出,模型本质上又成了一个 policy model,用来预测机器人为了接近具体目标,在真实环境中应采取什么动作。

在他的设想里,这类 Omni-Model 不仅能帮助具身智能研究者和开发者理解环境建模与决策规划,也可以作为基础骨干模型,在具体机器人应用上继续微调,以满足客户对可靠性和效率的要求。

为什么坚持三维与仿真路线

面对“为何不走纯视频模型路线”的问题,李昀烛给出的核心答案是一致性。他认为,要创建一个让机器人能够工作的世界,这个世界必须捕捉问题的本质结构,而一致性是必要条件,包括空间、时间、不同视角和不同交互方式上的一致性。

李飞飞详解 World Labs 收购 SceniX:先为机器人搭建可规模化数字训练场 4

他举例说,如果机器人试着把一个物体向前推,结果物体却离奇消失,那么很多现有视频预测模型就无法给机器人提供正确信号。视频模型虽然进展很快,但他们希望先建立一套基础设施,为数据飞轮提供初始动力,让系统从更偏仿真驱动的模型,逐步发展到能够在真实环境中执行的机器人策略模型,然后再采集新数据回流。

他还说,模型不需要只依靠物理,也不需要只依靠学习,可以位于两者之间,既抓住问题的本质结构,又能随着数据积累持续扩展和改进。

当被问到自己的“北极星”是什么时,李昀烛回答得很直接:让机器人在真实环境里工作。他提到,自己在斯坦福做博士后时,曾与李飞飞合作构建一项 benchmark,并向公众征集他们希望机器人代劳的任务。在收集的一千多项任务中,有三分之一与清洁有关。人们不愿做这些脏活累活,而这正是他们希望机器人优先进入的场景。

李飞飞则表示,她很欣赏 SceniX 联合创始人务实的工作方式。虽然团队大多来自学术界,但一开始就选择与真实产业中的设计者和客户合作,进入实验室、仓库和电子装配等真实场景推进研发,这种路线让她对合作很期待。

模型不必完美,但必须抓住问题结构

围绕机器人系统所需的精确度,李昀烛认为,环境模型不必完美,机器人模型也不必完美。主持人追问“至少也要非常接近现实吧”时,他解释说,模型一直都是许多机器人应用的基石。无人机、扫地机器人、四足机器人和双足机器人,都依赖模型工作,也依赖模型实现从模拟环境到真实环境的迁移。

他的观点是,模拟器不需要逐一复刻每一处灌木和积雪,但必须捕捉问题的本质结构,并在数字环境中支持不同形式的随机化。SceniX 正在研究的,是应当用怎样的保真度去建模机器人周围的世界,才能让在模拟环境和数字世界中训练出来的系统顺利迁移回真实场景。

仿真不是替代真实世界,而是与真实数据结合

对于“仿真是否最终会偏离物理世界”的质疑,李昀烛表示,两者并不矛盾。模拟本质上是在预测动作施加后环境如何变化,也就是对世界建模。这个模型不一定非要是纯物理模型,也可以把物理和学习结合起来。

他提到,SceniX 同样在收集真实世界数据,并会在数据飞轮的不同阶段使用这些数据。早期可能更强调物理,让机器人先学会世界的基本结构和学习节奏;随着数据采集和客户合作带来更多数据,环境建模就可以逐步转向更强的学习驱动,把物理、几何和一致性的优势,与数据和算力的能力结合起来。

李飞飞详解 World Labs 收购 SceniX:先为机器人搭建可规模化数字训练场 5

李飞飞的补充是,这不是“要不要模拟”的二元选择。她以人类学习为例,指出人类在行动前会在头脑中做大量模拟,模拟承担的关键作用之一,就是支持反事实推理。人们会推演尚未发生、无法发生或缺乏足够真实数据的事件,并从中学习行动方式,机器人也可以采用类似路径。

她还提到自动驾驶作为现实案例。Waymo 曾表示使用了数十亿小时的仿真数据,而且其路线高度依赖仿真,而不仅仅依赖真实世界数据。李飞飞认为,汽车还是相对简单的机器人问题,这已经说明仿真在机器人学习中扮演重要角色。

李昀烛把仿真的价值概括为两个层面:可靠性和效率。

  • 在可靠性上,要让机器人系统稳定工作,数据必须系统覆盖机器人可能遇到的状态空间和变化。仿真环境可以系统随机化并控制光照、几何类型和物理参数,提高覆盖度。
  • 在效率上,很多团队依靠遥操作采集数据,但现有遥操作设备和外骨骼下,采集速度甚至可能慢于人类直接完成任务。客户希望机器人比人更快,但提速并不等于简单提升驱动速度,因为重力恒定,动力学问题不会因此消失。仿真环境则可以系统加快机器人行为,并训练机器人同时考虑环境动力学变化。

他的结论是,仿真在可靠性和效率两方面都能提供独特价值。

SceniX 平台主要做训练和评估

谈到自家平台的用途时,李昀烛说,核心是两件事:训练和评估。其中评估在机器人行业里经常被忽视,但训练机器人模型时,必须知道模型到底表现如何,而评估正是推动迭代的信号来源。

他给出了一个很具体的例子:如果要区分一个成功率为 90% 的 checkpoint 与另一个 92% 的 checkpoint,关键在于验证这 2% 差异要花多久。如果每次都得把模型部署到真实物理世界中测试,验证周期会长到难以忍受。

他表示,当前真实世界中的机器人评估速度,比语言模型评估慢多个数量级。机器人任务本身也高度多样,必须真实执行动作、在空间中移动并服从物理规律。很多机器人演示视频会用 8 倍或 10 倍速播放,原因正是机器人本身运行得很慢。

李昀烛说,真实环境评估不仅慢,而且危险且昂贵,所以部分客户需要用于评估机器人系统的数字环境。由于 SceniX 的数字环境已经被证明与真实世界具有对齐关系,如果某个 checkpoint 在仿真中表现更好,那么它在真实环境中也很可能更好。这样一来,就可以利用数字环境中的信号,对机器人系统进行更安全、更可扩展、也快得多的评估。

李飞飞详解 World Labs 收购 SceniX:先为机器人搭建可规模化数字训练场 6

训练侧的关键则是可控性。他表示,团队希望控制状态、参数、光照、摩擦力及其他物理参数,乃至物体几何类型的变化。训练必须覆盖足够多样化的场景,才能生成信息量足够的数据,提升机器人系统的稳健性,而这些条件在真实环境中很难系统实现。

通过遥操作采集数据,不仅速度慢,还会受到机器人数量、远程操作设备数量以及一系列数据运营问题的制约。相比之下,仿真环境具备完全可控和可解析的特征。在数字世界里,开发者可以明确界定数据分布的覆盖范围,并确认机器人在该分布内的可靠性。李昀烛说,这种确定性、高效性与可扩展性,正是客户选择数字世界训练机器人系统的核心原因。

李飞飞也提到,在 SceniX 与 World Labs 接洽前,就已有客户因为类似需求主动联系 Marble。虽然当时 World Labs 还不具备相应服务能力,但已收到不少机器人公司的咨询,既有早期模型研发团队,也有希望把系统落到实际应用场景中的企业。

平台不绑定机器人形态,也不押注单一模型

对于 World Labs 与 SceniX 在机器人生态中的定位,李昀烛给出的回答是:他们构建的是一套基础设施及配套软件,让开发者创建机器人可以在其中学习和接受评估的世界。这套基础设施天然不绑定具体模型,也不绑定特定机器人形态。

他表示,无论是单臂还是双臂,固定底座还是移动底座,甚至不同夹爪和复杂末端执行器,都可以进入这套数字世界运行。目标只有一个,就是让这些系统到了真实环境里依旧稳定、高效。

在模型层面也是同样思路。SceniX 生成的数据既可以用于从头训练新模型,也可以用于微调当前流行的 VLA(视觉-语言-动作)模型或 World Action Model。李昀烛直言,具体采用哪个模型并不重要,因为模型总会换代,但基础设施不会。

他的总结是,团队不站队硬件,也不押注单一算法,只做一件事:搭建一个通用数字世界,让不同机器人都能在其中训练,并把能力迁移到真实世界。

落地路径先从半结构化环境开始

谈到机器人落地路线时,李昀烛表示,真实世界中的机器人部署通常遵循一条从完全结构化环境,到半结构化环境,再到非结构化环境的演进路径。

李飞飞详解 World Labs 收购 SceniX:先为机器人搭建可规模化数字训练场 7

他解释,完全结构化环境如工厂或汽车产线,变量已知且可控,这类场景已经自动化了几十年。半结构化环境则更像亚马逊仓库、餐厅或酒店,环境整体可控,任务也会按机器人做一定适配,但仍会出现衣物等难以预料的干扰物。至于非结构化环境,比如普通家庭,则是机器人行业的终极目标。

在他看来,稳健性来自于对场景的充分覆盖。至少在当前阶段,优先解决半结构化环境,比直接进入完全非结构化环境更可行。他表示,团队最终会走向后者,但希望走的是一条更可持续、也更务实的路径。

李飞飞则从身体形态谈到人形机器人。她指出,人形机器人模仿人体,是因为人类通过进化已经适应了非结构化环境。但人的手指和双腿并不是执行任何单一任务的最优工具。人类最终形成的是一种通用性很强、但在单一任务上未必最优的身体形态,因为这种形态有利于在非结构化环境中生存。

她说,从商业和务实技术角度看,非结构化环境加上通用身体,是最难解决的组合。对某些具体问题来说,更专用的身体形态可能更适合更窄的任务。因此,SceniX 面临的挑战之一,就是保持对机器人形态的中立,让基础设施能适配不同身体形态和不同半结构化环境。

距离人类级能效仍有很长距离

在讨论机器人能否在日常体力任务中达到人类的能量性价比时,李昀烛表示,这仍需要很长时间。因为机器人要在真实环境里工作,本质上是一个系统问题,需要同时考虑硬件、软件和“大脑”的协同,甚至要落到手指摩擦系数这类细节。系统真正落地,既依赖许多条件逐步到位,也离不开持续迭代。

不过,他也表示,机器人学习的技术前沿推进速度比自己预期更快。他现在研究的问题,已经与博士时期完全不同,这说明整个生态正在快速演进,构建机器人系统所需的各类组件开始汇聚。

他的判断是,未来会出现大量进展,但要达到人类级别的能量性价比和整体能力,还需要更久时间。

李飞飞则说,当下 AI 最难做到的一点,就是保持恰当且经过校准的乐观。她提到,即便是大型语言模型,在能效上也还远不及人脑,而人脑运行功耗大约只有 30W,因此当前差距仍然很大。

李飞飞详解 World Labs 收购 SceniX:先为机器人搭建可规模化数字训练场 8

合并后的节奏与两年目标

对于加入 World Labs 后的变化,李昀烛说,这次合作“以非常深刻的方式改变了我们的轨迹”。他认为,和 World Labs 协作后,团队在整个环境建模流程上可以采用更高效、也更可扩展的方式推进。

他提到,当前语言模型能力虽然很强,但用户通常仍不会完全不检查结果,就任由模型替自己预订机票或酒店。机器人则不同,一个开箱即用的机器人模型,必须能在真实环境中可靠运行。眼下,行业既缺足够数据,也缺让机器人实现开箱即用和可靠运行所需的完整基础设施。因此,创建一个让机器人可以学习和接受评估的可扩展数字世界,会释放出巨大潜力。

在整合节奏上,李飞飞表示,团队会审慎推进,不会急于马上把全部代码库和团队彻底融合。她指出,SceniX 已经有一套经过深入思考、相对完整的技术栈,也有自己的客户和产品,所以会保留时间窗口。不过整合一定会发生。双方已经开始讨论仿真,以及潜在的基础模型和动作条件模型,SceniX 也正在以内部客户身份使用 Marble。

她还透露,李昀烛会带着部分团队成员搬到旧金山。搬迁完成后,World Labs 将成为一家横跨美国东西海岸的公司。公司总部在旧金山,同时将在纽约设立办公室。李飞飞表示,这有助于公司吸引东海岸人才。双方还讨论过在两地办公室部署机器人,以测试和完善远程操作机器人的工程技术栈,因为未来面向客户时也需要具备这类能力。

对于两年后的理想成果,李飞飞给出的目标非常具体:如果 SceniX 团队和 World Labs 能在少数几个重要垂直用例中,拿到经过验证的客户,并证明系统和基础设施确实能帮助客户满足自动化需求,她就会非常满意。这些客户将成为“灯塔案例”,帮助公司继续扩大业务。

参考信息

完整访谈:
https://www.youtube.com/watch?v=-tabaM5l3s0

参考链接:

  • https://marble.worldlabs.ai/
  • https://www.worldlabs.ai/blog/scenix

本文信息来自微信公众号“量子位”对访谈文字实录的整理与精校,MarsBit 进行了转载。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。