神秘具身模型 10 分钟一镜到底演示引发行业关注

神秘具身模型 10 分钟一镜到底演示引发行业关注

N
News Editor
2026-08-26 04:11:13
MarsBit刊发、转载自微信公众号“量子位”的一篇文章称,一段 10 分钟、一镜到底、无剪辑的具身智能 Demo 同时展示了宇树和智元两款不同机器人平台在同一“大脑”驱动下完成家务协作。文章逐段拆解视频中的擦窗、收纳、任务中断后恢复、跨本体协作和借助箱子取高处物品等场景,并援引“知情人士”说法称,该模型跳出了 VLA、WAM 和传统世界模型的既有框架。文章同时指出,相关模型来源尚未披露。

MarsBit 发布的一篇转载文章称,一段时长 10 分钟、全程一镜到底的具身智能 Demo,正在引发行业关注。文章来自微信公众号“量子位”,作者为诺亚。按文中描述,这段视频没有剪辑、没有场外遥控、没有人工指令介入,画面中同时出现了宇树和智元两种不同本体的机器人,并由同一套模型完成协作。

神秘具身模型 10 分钟一镜到底演示引发行业关注 2

文章开头指出,当前不少具身智能公司的 Demo 更像制作精良的广告片,而这段视频则以“无剪辑、无重拍”的方式呈现真实作业过程。作者称,视频里机器人能够把手臂伸出窗外擦玻璃,在够不到高处时主动搬箱子尝试垫高自己,在长程任务被打断后还能继续恢复执行。

更受关注的一点在于,视频中出现的宇树和智元机器人,在硬件架构、运动自由度和传感系统上并不相同,但文章认为它们共用了一个“大脑”,并完成相互配合。这被作者形容为罕见的跨本体通用大脑样本。

15 平方米出租屋中的连续作业

文章称,视频拍摄地点是一间约 15 平方米的出租屋,家具密集、过道狭窄,连转身空间都较为有限。作者据此判断,这样的场景很难容纳遥操作人员,也不适合预设脚本式演示。

按文章描述,两台机器人在同一空间里并行完成家务,能够实时感知边界、规划路径,整个过程没有碰撞、迷路或停滞。其中一台还处于被牵引绳拴住的状态,但仍表现出较高的灵活性。文章反复强调,这段视频没有切镜、没有重拍,也没有人工指令介入。

从擦窗动作观察力控、感知与推理

视频第一个任务是擦玻璃。文章描述,一台宇树机器人使用刮水器清洁窗户。作者认为,使用刮水器比用抹布更考验力度控制和空间感知,因为力量过轻会擦不干净,过重则可能产生异响。

在擦拭过程中,机器人发现有一处没有清理干净,随后自行判断污渍可能位于窗外,继而完成一套连续动作:侧身、后仰、探头、展臂,把拿着刮水器的手伸出窗外继续擦拭。文章强调,这一动作不仅体现了力矩控制,还融合了空间环境感知和动力学解算,过程中手臂也没有碰到窗框。

神秘具身模型 10 分钟一镜到底演示引发行业关注 3

作者将这一表现概括为视觉、触觉与动力学能力的统一化呈现,并认为其展现出了一种类似“自我推理、自我进化”的能力。文中还写道,这也是作者第一次在演示中看到模型像人一样做出临场决策,在原方案失效后改变动作路径。

长时序任务中的闭环执行

擦完玻璃后,宇树机器人将刮水器平稳放回原位。文章指出,这个动作意味着“取工具—作业—收纳”的完整闭环已经完成。

与此同时,另一台智元机器人走向洗衣机,取出洗干净的坐垫并放到沙发后方,随后返回继续从洗衣机中取出洗好的娃娃,再将其放进二层衣柜。作者强调,每件物品都被放回对应位置。

文章还提到,智元机器人曾不小心撞到玻璃。作者据此反向判断,这更接近自主决策的结果,因为摄像头在玻璃反光场景下可能存在识别限制,而如果由人直接遥控,理论上更容易规避这一问题。

在作者看来,这些场景共同反映出模型在长时序任务中依旧能保持动作流畅、定位准确,不会随着任务增加和时长拉长而快速累积误差。这一点被拿来对比传统 VLA 模型在长序列任务上的常见弱点。

任务可中断,并在断点处恢复

接下来的一个细节,是视频里出现了一声闹钟铃声。文章称,起初并不容易理解这个设置的用途,但在反复观看后,作者认为闹钟应该是预设提醒,会打断两台机器人正在执行的任务,让它们转而处理桌面和冰箱的收纳工作。

神秘具身模型 10 分钟一镜到底演示引发行业关注 4

更关键的是,在完成这项临时插入的任务后,机器人又恢复到被打断前的任务流程中继续执行。文章据此判断,这套模型具备随时中断、断点续做和任务恢复的能力。

随后,视频进入一整套居家收纳流程。文章描述,宇树机器人拿起收纳袋放到桌面,智元机器人则看到冰箱上的食物后,判断其应放入冷藏区域,随即执行,同时还取出了应当解冻的食物。作者在这里加入了个人猜测,称这支神秘团队似乎在暗示机器人离“做四菜一汤”也不远了。

但文章也明确指出,整个过程中并没有看到分步指令输入,机器人是自主拆解任务、规划动作,并完成从取物到归置的完整链条。作者将这种能力概括为具备人类级别的任务优先级判断与动态调度能力。

宇树与智元的跨本体协作

文章认为,整段视频的高潮出现在两台机器人整理桌面杂物的阶段。按文中描述,宇树机器人不断将物体堆放到自己身上,试图一次性搬运更多杂物,直到双手被占满后难以继续操作。

此时,智元机器人走近桌边,拿起一条围巾,缓慢挂到宇树机器人的脖子上。由于围巾较长,智元随后改为双手捧起围巾,而宇树也做出弯腰动作配合,让对方将围巾绕过头部并挂到脖子上。

作者认为,这一过程不是提前写好的固定分工,而是同一套模型在两个不同本体之间自主探索出的协作方案。文中称,两台不同品牌的机器人能够自行判断各自能力边界并形成互补,这种协同方式已经非常接近人类协作。

神秘具身模型 10 分钟一镜到底演示引发行业关注 5

文章甚至提出,这可能是世界上第一次跨本体交互,也可能是第一次出现通用本体模型。不过,这一判断属于作者基于视频作出的推断,模型开发团队身份在文中仍未披露。

挂毛巾与拎拖鞋细节被解读为“省力策略”

在宇树机器人挂满物品离开后,智元机器人继续整理剩余物品。文章提到,它拿起一条毛巾,尝试把毛巾挂在自己身上,连续尝试了一次、两次、三次,最终将其挂到肩头。

作者将这一细节解读为机器人知道怎样做更省力:与其一直拿在手里,不如把毛巾搭在肩膀上。同时,连续尝试后成功,也被文章视为模型能够在失败后持续调整动作、优化策略的表现。

类似的还有整理拖鞋时的动作。文章称,机器人拎起的是新拖鞋的挂绳,而不是鞋体本身。作者认为,这也是一种更省力的取物方案,并进一步推断模型具备对本体能力的理解,而这可能是其跨本体应用的重要原因。

够不到高处时,机器人尝试用箱子垫高自己

文章称,最令作者震惊的一幕,是宇树 G1 机器人在归置身上物品时,面对第三层柜子的高度限制所做出的反应。由于机器人身高只有 1.3 米,它无法直接把围巾放到高处。

按文中描述,机器人没有停住,也没有放弃,而是自己找到旁边的一个箱子,试图把箱子挪到柜子旁边,站到上面再继续尝试。它先把箱子推倒在地,接着弯腰想搬起箱子,但发现自己弯不下去。

神秘具身模型 10 分钟一镜到底演示引发行业关注 6

在几次尝试未果后,机器人改用脚把箱子踢向柜子一侧。文章认为,这一过程体现出三层能力:一是自我推理与决策,知道怎样才能够到更高的位置;二是对自身身体能力边界的持续探索;三是在没有教学的情况下,学会利用脚来推动箱子,形成自发的策略演化。

作者将“自主使用工具”视作人类的重要标志,并据此判断,这一动作背后体现的是对物理世界规则、自身能力和决策进化的综合理解。

从个体协同到群体协同

在视频后段,宇树将箱子踢到柜子旁却没有摆正。就在它还在尝试处理时,身高 1.7 米的智元远征 A3 走了过来。文章描述,智元放下了手里的小拉车,主动切换任务,选择先帮助同伴完成围巾归位。

随后,宇树弯腰低头,智元将围巾从其脖子上取下并放到架子上。文章认为,这个过程中,智元先将围巾绕过宇树脑后再取下,体现了对力度控制和空间感知的把握;接着又将围巾折了三折,再放进衣柜,被作者视作对收纳方式的自主判断。

在帮助宇树完成这一任务后,智元离开,最后把一件衣服放进洗衣机。作者猜测,机器人可能判断出搭在洗衣机上的那件衣服是脏衣服,因此做出这一处理。

至此,这条 10 分钟的一镜到底视频结束。文章总结说,首次看到的跨本体协作、自主进化、类人的路径选择、极致的空间感知与力控、任务可随时打断并恢复、以及工具使用能力,都在这段视频中集中出现。

神秘具身模型 10 分钟一镜到底演示引发行业关注 7

文章对底层技术路线的判断

在视频拆解之外,文章还引用“知情人士”的说法称,这套模型最重要的一点,是跳出了当前主流具身模型的固有框架。文中将现阶段主流具身模型大致分为 VLA、WAM 和传统世界模型三类,并逐一概括其局限。

文章写道,VLA 更像“数据直觉派”,依赖海量视觉、语言、动作数据进行端到端拟合,但本质上仍是“看图猜动作”,缺少物理推理能力,在长序列任务中容易持续累积误差,陌生场景下的泛化能力有限,而且高度绑定特定本体。

至于 WAM 和传统世界模型,文章将其称为“预判空想派”。这类模型试图先建模世界规律再规划动作,但存在“知行割裂”问题:可以理解场景和预判状态,却在需要物理动力学推理的实操场景中,仍然受限于训练数据推演,难以应对真实环境中的动态变化。

作者的结论是,上述主流路线共同的底层缺陷,在于它们都属于数据驱动的任务拟合,模型动作来自海量数据下的概率猜测,而不是对物理规则的深度理解。这会让模型能力上限被训练数据锁定。

关于训练数据、Scaling Law 与三项技术内核

文章还称,据说视频中的模型只用了几十个小时的视频数据进行训练。作者据此提出疑问:如果在这样低的数据量下也能达到视频中展示的效果,那么 Scaling Law 是否仍然成立,值得重新审视。

在能力拆分上,文章认为,这套模型至少展现了现阶段 VLA 和世界模型难以达到的四项能力:

神秘具身模型 10 分钟一镜到底演示引发行业关注 8

  • 动力学建模:轨迹满足动力学可行性,能够计算补偿力矩和前馈项,并具备较强外推泛化能力;
  • 自我认知能力:不像 VLA 依靠条件反射,也不像 WAM 依靠时序统计,而是更接近“下一步最接近目标的动作是什么”这种推理方式;
  • 自适应能力:能够补足因果推理,处理长尾问题,在执行过程中持续调整;
  • 自我进化能力:在任务执行过程中实现技能增长和策略演化,像是能自我驱动产生学习目标并主动推理。

围绕这些表现,文章进一步总结出三项底层技术内核。第一是物理约束动力学学习,即把物理规则前置,用动力学预测驱动训练,而不是完全依赖数据驱动。文中提到的拎拖鞋挂绳、肩搭毛巾、站箱子登高等动作,被作者视为机器人与环境交互后自主探索出的最优解。

第二是跨本体统一建模。文章称,通过统一的动作表示空间和本体自适应机制,同一套模型可以适配不同品牌、不同架构的硬件平台,相当于完成了具身智能中的“软硬件解耦”。

第三是长时序鲁棒闭环。文章认为,依托全局任务调度框架,这套模型能够自主处理突发干扰、动作误差和任务切换,从而避免传统模型在长流程里因误差累积而失效。

模型来源尚未披露

文章最后表示,目前还不知道这套神秘模型出自哪一团队。作者认为,与其他团队仍在展示短时长、精修、单任务 Demo 相比,这段视频已经展现了 10 分钟无修剪、跨品牌、多协同、全流程和自进化的实景作业能力。

同时,文章将其描述为一次可能颠覆既有技术路线、并逼近具身智能“ChatGPT 时刻”的演示。不过,这些判断均来自原文作者及其援引的“知情人士”说法。就输入信息而言,模型开发方身份、技术细节和更多验证材料仍未公开。

本文来自微信公众号“量子位”(ID:QbitAI),作者:诺亚。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
10

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。