王兴兴:具身智能的“ChatGPT时刻”最快两三年到来

王兴兴:具身智能的“ChatGPT时刻”最快两三年到来

N
News Editor
2026-08-20 04:09:00
宇树科技创始人王兴兴在2026世界机器人大会演讲时表示,机器人产业正处在人工智能加速发展的新起点,当前最大瓶颈仍是具身智能泛化能力不足。他判断,具身智能迎来类似ChatGPT的产业临界点,快则两到三年,慢则五到十年。演讲还回顾了宇树从四足机器人到人形机器人的十年历程,并介绍了G1、H1、GD01、As2-W、R1等产品,以及通过AI、数据和真机闭环推动机器人研发自进化的思路。

宇树科技上市后第二天,公司创始人王兴兴在2026世界机器人大会发表题为《从展品到产品:人形机器人产业的下一个十年》的主题演讲。他在演讲中表示,当前机器人产业正站在人工智能加速发展的新起点,但现阶段最大的瓶颈仍然是具身智能的泛化能力不足。就行业何时会迎来类似ChatGPT的产业临界点,王兴兴给出的判断是:「从发展周期来看,快则两到三年,慢则五到十年,行业有望迎来关键突破。」

王兴兴:具身智能的“ChatGPT时刻”最快两三年到来 2

谈到通用机器人何时真正进入家庭时,王兴兴说,全球范围内最大的限制仍是泛化能力不够。他提出了一个判断标准:如果有一天,人们把一台机器人带到任意陌生环境中,它基本可以完成约 80% 的任务,「我觉得就差不多已经实现了具身智能的ChatGPT时刻」。

宇树十年:从四足机器人走向人形机器人

王兴兴在演讲开头回顾了宇树科技的发展历程。宇树科技成立于 2016 年 8 月,到 2026 年 8 月接近整整 10 年。公司最早做四足机器人,近几年开始做人形机器人。

他提到,宇树近几年较为成功的一款产品是 2024 年推出的 G1。按他的说法,G1 推出后,基本成为全球人形机器人领域较有代表性的产品。现在外界能看到的很多人形机器人产品,无论整体形态还是设计思路,都与 G1 有一些相似之处。

今年年初,宇树参与春晚表演《武BOT》。王兴兴介绍,这个节目融合了中国传统功夫和武术文化,团队提前采集了几十个有代表性的中国功夫动作,再进行 AI 训练,最终将较为精彩的动作搬上舞台。他认为,这个节目把较前沿的人形机器人技术与中国传统功夫、武术文化放在了一起,是科技与文化结合较好的例子。按他的说法,该视频在海外传播效果很好,「可能有数百亿次播放」。

王兴兴还提到,2 月份宇树在天坛做过一次演示,当时现场约有 49 台机器人进行全自动表演。他说,天坛本身有几百年的文化和历史,机器人在这样的场景中表演,会形成很强的穿越时空感,把中国过去几百年的文化与当前最新技术结合在一起。

过去几年,宇树也一直在推动机器人进入生活和工厂。王兴兴表示,2024 年公司已经开始与汽车工厂合作进行一些落地应用,也在自己的工厂内部部署机器人,做简单测试和应用。现在公司绝大部分 AI 团队都围绕机器人真正进入家庭或工厂干活展开研发。

至于为什么还没有大规模推广,他的回答是,机器人的效率和泛化能力还不够。当前机器人已经能做一些简单装配,但效率与人相比仍偏低;同时,每次遇到新任务,往往还需要重新训练,这又会进一步拉低整体效率。因此,宇树希望先把技术的泛化能力做好,再推进更大规模的推广。他也将这一点概括为全球机器人行业共同面对的核心瓶颈。

在产品进展上,王兴兴提到,宇树在今年 4 月刷新了人形机器人奔跑速度纪录。这款机器人是在 2023 年第一代人形机器人 H1 的基础上改制而来。H1 是宇树第一款人形机器人,也是公司较经典的产品。此后,团队还在 H1 基础上尝试不同形态,例如加入轮式结构,让机器人在部分场景中更灵活。

AI、数据与真实场景构成机器人能力底座

王兴兴表示,现在的机器人基本都是 AI 驱动,而 AI 本质上又是数据驱动。数据规模,尤其是高质量数据的规模,在很大程度上决定了 AI 能力上限。因此,宇树一方面自己采集数据,另一方面也和第三方公司合作,希望获取更多数据,既供行业使用,也供自身使用。

在他看来,真正用于 AI 机器人训练的数据,应该以大量真人数据或互联网数据作为主要预训练数据,再叠加一部分真机数据。这两类数据都不可缺少。从数据规模看,真人数据会更多,也更重要;但真机数据同样是刚需,因为最终仍要让机器人与真实物理世界匹配起来。

今年 5 月,宇树发布了全球首款量产级载人变形机甲 GD01。王兴兴介绍,这款机器人身高 3 米多,载人后重量约 500 公斤。对于应用方向,他将 GD01 比作一辆「越野车」,并称它并非主要面向家庭或城市日常使用,而更适合户外、复杂环境及部分运输场景,例如户外徒步或复杂地形中的物资运输。

GD01 的另一项特点是可以切换到四足模式。王兴兴说,进入四足模式后,稳定性会更好,越障能力也较强。这也是宇树愿意把它拿出来预售的原因之一:在四足模式下,它已经具备相对较好的稳定性和复杂地形通过能力。按他的表述,可以把它理解成机器人形态的「越野车」。

前几个月,宇树还演示了一个基于多模态模型的端到端 AI 动作生成系统。王兴兴说,过去很多机器人动作演示都是提前采集、提前训练好的,而这套系统的动作可以根据实时语音指令生成。语音需要先被识别,再上传到云端生成动作,之后还要对动作进行验证,确认无误后再下发给机器人,因此目前整个过程仍存在几秒钟延迟。

他表示,宇树希望未来机器人真正落地时,动作能够完全实时生成,而不是依赖提前编程。现阶段这种自动生成方式还有一个特征:即便输入完全相同的指令,每次生成的动作也可能略有差异。也就是说,同一句话在不同时间下达,机器人的动作表现不一定完全一样。

在日常场景中,宇树也在推动机器人进入会议室执行任务。王兴兴举例说,公司会议室有时会较乱,而会议室整理就是一个明确且有实用价值的任务。团队的训练目标是,即便把一个会议室任意打乱,机器人也能将其恢复到干净整洁的状态。

他介绍,这一任务目前是完全端到端实现的,因此机器人的运动效率还比较慢。但这并不是一个单任务系统。在该场景中,团队设置了约 7 到 8 个不同任务,用一个模型让机器人在不同任务之间自动切换并直接执行,同时具备一定抗干扰能力。由于 AI 需要实时识别、实时生成并持续推理,动作还不够流畅,每走一步、每做一个动作都要推理,这会影响整体顺滑程度。不过他强调,演示视频是一镜到底,没有剪辑,也加入了环境干扰。

在此基础上,宇树又把语音驱动和多模态模型结合起来,让机器人不仅能根据语音生成动作,还能真正完成交互和操作任务。王兴兴说,在现场演示中,机器人可以识别眼前物体颜色、判断不同药盒的位置,再根据语言指令拿出指定物体。也就是说,机器人执行的不再是一个预设好的固定动作,而是需要理解语言、识别环境,再完成操作。

王兴兴还提到,前段时间宇树发布了最新一代轮足四足机器人 As2-W。这款机器人较为轻量化,带电池重量约 25 公斤,负载能力和续航能力都较强,同时具备 IP54 防尘防水能力,可覆盖室内和室外场景。

他说,宇树把一些在人形机器人上积累的技术重新应用到四足机器人上,希望继续提升四足机器人的灵活性,并把负载、续航和复杂环境适应能力做得更好。公司也希望 As2-W 未来能够真正用于户外徒步、运输和一些工业场景。

与此同时,宇树也在持续升级 R1 这类轻量化人形机器人,提升其运动能力和灵活性。按王兴兴的说法,R1 的性价比较高,已经可以通过京东、淘宝等渠道购买。

前段时间,宇树还展示了一款新的机器人。王兴兴表示,这款机器人开发时间很短,到目前仅用了三个多月,还不是正式发布版本。它的最高速度已达到 12.65 米/秒,超过人类历史上最快运动员的峰值奔跑速度;按照目前测试结果,其跳跃高度也超过了人类历史上的最高跳跃水平。他还提到,2025 年他本人、公司的产品以及宇树科技都曾登上《时代》杂志相关榜单。

王兴兴:具身智能当前最大问题仍是泛化能力不足

在谈及近几年具身智能 AI 模型的发展时,王兴兴提到,目前较主要的技术路线包括 VLA 模型和世界模型。今年行业里被提及较多的方向之一,就是世界模型。

他说,宇树在 AI 模型上的投入一直很大,也是公司目前资金和人力投入最大的方向之一。早在 2020 年初,宇树就开始探索基于视频生成的世界模型。到了 2020 年底,效果还不算理想,因此中间一度搁置;但从去年开始,宇树重新加大了对视频生成世界模型方向的投入。

对于「真正通用的机器人什么时候才能走进生活、走进家庭」这个问题,王兴兴的回答仍然聚焦在泛化能力。他表示,现在很多 AI 模型在固定场景里,只要做足够的数据采集和训练,成功率基本可以接近 100%;但只要操作物品稍有变化,或者环境发生一点变化,成功率就会明显下降。

基于这一现状,他再次给出了时间判断:快的话可能两三年,慢的话五年甚至更长。如果有一天,把一台机器人带到一个它完全陌生的环境,比如一个从未见过的家庭,它仅通过语音或语言指令,就能完成约 80% 的任务,那么在他看来,就差不多到达了具身智能的「ChatGPT时刻」,这也会成为未来产业真正爆发的关键临界点。

王兴兴进一步把这个临界点概括成一个相对简单的评价指标:机器人在约 80% 的陌生场景里,仅通过语音或语言指令,就能完成约 80% 的任务。他认为,这是一个非常重要的临界点。

至于为什么现在还达不到这一水平,他表示,最大的瓶颈之一在于 AI 模型的输入输出与真实机器人、真实物理世界之间的对齐程度还不够。

他举例说,当让机器人移动、装配两个物体,或把一个物体从一个地方搬到另一个地方时,它在大的方向上通常没有问题,能够理解任务,也大致知道如何执行;但真正影响最终成功率的,往往是最后几厘米,甚至最后几毫米。

例如机器人去抓取一个物体时,看起来手已经快要拿住了,但在最后一点触觉反馈和最后一点位置误差上,它还无法很好修正。一旦这一误差没有处理好,最终就可能导致整个任务失败,成功率会明显下降。

王兴兴把这一问题概括为当前全球具身智能面临的核心难题:AI 模型的输入输出与真实世界之间存在偏差。

他还解释了为什么机器人会明显受到这个问题影响,而一般语言模型或多模态模型没有这么突出。按他的说法,语言模型处理的内容本质上都是数字编码,输入和输出被严格限制在数字空间或向量空间中,误差不会以同样方式持续累积。

但机器人不同。机器人的每一次输入和输出都要进入真实物理世界,每执行一次动作,都会产生一定偏差和损失。这些偏差会影响下一次感知和下一次动作,最终形成误差累积。也正因如此,当前机器人模型的泛化能力和实际任务成功率还没有达到足够高的水平。

对于这一问题的解决节奏,王兴兴表示,他认为未来几年一定能够解决,但仍然需要一些时间。

用 AI 重构机器人研发流程,推动模型自进化

除具身智能本身的技术瓶颈外,王兴兴还介绍了宇树正在推进的另一件事:直接让物理 AI 机器人模型实现自进化。

他说,过去几年,外界已经大量使用 AI 做编程和各种 AI 开发,但 AI 本身在机器人研发流程中的使用仍相对不足。宇树最近推动的方向,是尝试用当前最前沿、最顶尖的大模型来驱动机器人研发。

具体做法上,团队可以先给 AI 设定规则、经验、约束和工具,让它自己去网上搜索最新论文、较好的研究成果和各类开源方案,随后由 AI 自己编程,生成机器人的控制代码。

控制代码生成后,可以先放到仿真环境中运行和训练,也可以进一步调用模型和控制系统,去驱动真实机器人。

如果部署到真实机器人上,就可以进行真实测试,再对测试结果评价和打分。王兴兴表示,评价的一部分可以由机器人 AI 模型自行完成,另一部分也可以由人参与,因为很多时候,人可以很容易判断一个动作做得好不好。

在他看来,如果这套逻辑真正形成体系并持续运行,机器人的开发效率会提高很多,迭代速度也会非常快。这个流程运行一段时间后,就有机会真正形成机器人自我进化能力的提升。

王兴兴举了一个相对简单的例子:可以使用一个 Coding 智能体,让它自己编写机器人的控制代码。对于一些较简单的深度强化学习算法,他说,使用 Coding 智能体自动编程,当前效果其实已经不错。

在这个流程中,代码生成之后,先放进仿真环境做验证和训练;效果达到一定程度后,再部署到真实机器人做测试。测试完成后,一方面由 AI 模型进行评价,另一方面也加入人工打分,判断效果如何。再把这些结果反馈给编程智能体,进入下一轮代码生成和优化,最终形成一个持续迭代的正向循环。

王兴兴也说明,刚才提到的只是一个最简单的示例,真正使用时会复杂得多。但在他看来,这仍是当下以及未来几年全球机器人行业非常值得做的一件事。

至于为什么要这样做,他给出了几项原因。

  • 第一,基础模型能力每个月、每年都在提升,自进化循环本身的能力也会随之提升。这意味着,这套系统能够跟随全球 AI 基础能力进步而持续增强。
  • 第二,它可以更充分利用多元数据。过去依靠人工处理和使用数据,整体效率较低;如果形成自循环,就能把各种训练数据、真实世界数据以及人的数据都利用起来,而且数据利用效率更高。
  • 第三,它可以与更多真机部署形成闭环。随着真实机器人部署越来越多,系统会不断获得新的测试数据,也会积累越来越多的评价指标,从而保证整体数据利用率和数据增长速度。
  • 第四,它能够持续积累机器人的技能。团队可以每天、每个月不断增加新的技能,而不是开发完一个技能后又浪费掉,或者重新从头做一遍。技能、数据、控制策略和评价结果都可以在这一系统中持续沉淀。

基于上述原因,王兴兴表示,他认为真正使用 AI 去大幅提升机器人的开发效率和进化效率,是一件非常重要的事情。未来,这种方式很可能会成为物理 AI 机器人持续进化的一条重要路径,也可能打开一个新的阶段。

演讲最后,王兴兴回顾说,宇树已经走过约 10 年,公司大概在 2017、2018 年第一次参加世界机器人大会,这些年一路走下来,感受很深。站在今天这个新的阶段,尤其是在 AI 快速发展、全球对机器人关注度较高的背景下,整个机器人的进化速度已经明显加快,未来的发展速度可能还会比他当前预估得更快。

他说,「我觉得,这是一个全新的起点,也是一个全新的开始。」由于时间关系,他表示当天的汇报相对简短,并向现场致谢。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
50

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。