王兴兴称具身智能“ChatGPT时刻”未至,行业判断集中在未来2至5年

王兴兴称具身智能“ChatGPT时刻”未至,行业判断集中在未来2至5年

N
News Editor
2026-08-21 04:20:00
在2026世界机器人大会上,宇树科技创始人王兴兴表示,具身智能距离自己的“ChatGPT时刻”仍需2至3年,慢则5年到10年,关键瓶颈在于机器人进入陌生环境后的泛化能力与执行稳定性。银河通用CTO王鹤将这一节点放在2028年。一个月前WAIC圆桌上,6位创业者和研究者给出的时间也全部集中在未来2至5年。多位受访者同时指出,具身智能即便出现技术拐点,商业化扩散也未必会像ChatGPT那样在单一时点爆发。

在人形机器人热度持续升高之际,宇树科技创始人王兴兴给市场预期降了温。

王兴兴称具身智能“ChatGPT时刻”未至,行业判断集中在未来2至5年 2

8月20日,在2026世界机器人大会上,王兴兴在宇树科技上市后的首场公开演讲中表示,具身智能的“ChatGPT时刻”还没有到来,快的话还需要2至3年,慢的话则可能要5年甚至10年。

过去两年,人形机器人已成为最受关注的科技产品之一。从各类晚会舞台、游戏展会,到商场和零售门店入口,机器人频繁出现在公众视野中。它们可以跳舞、行走、挥手,也能与观众握手互动,正快速从实验室走向展示场景。

但展示热度之外,机器人的实际能力与外界对“未来机器人”的期待仍有明显距离。外界关心的并不只是机器人能否上台表演或承担营销任务,而是它们何时能真正进入工厂和家庭,完成搬运、整理、工具操作、家务或护理类工作。问题始终很直接:机器人什么时候才能真正干活。

在大语言模型领域,ChatGPT提供过一个清晰参照。它不是第一款语言模型,但它第一次让大量普通用户直观感受到,AI已经跨过一个能力临界点。类似时刻何时会在具身智能领域出现,也成了机器人行业最受关注的话题之一。

王兴兴:关键门槛是陌生环境中的泛化能力

在王兴兴看来,当前具身智能最核心的瓶颈,仍是行业反复讨论的“泛化能力”。

他表示,很多机器人模型在固定场景内,只要完成足够的数据采集和训练,任务成功率已经可以接近100%。可一旦操作对象变化,或环境发生轻微改变,成功率就可能明显下滑。

这道门槛,直接关系到机器人能否真正进入日常生活和家庭。

王兴兴给出了一个较为具体的判断标准:如果有一天,把一台机器人带到一个完全陌生的家庭或环境中,它只凭语音或语言指令,就能完成大约80%的任务,那么具身智能就差不多迎来了自己的“ChatGPT时刻”。按照他的判断,这一节点最快还要2至3年,慢则可能需要5年甚至10年。

他特别提到,真正困难的地方,不是让机器人“大致知道怎么做”,而是最后几厘米,甚至几毫米。

以抓取动作为例,模型可能已经规划对了动作路径,机械臂也移动到目标附近,但只要最后的位置误差、触觉反馈,或抓取力度没有校正好,整个任务就可能失败。

这也是机器人与大语言模型的明显差别。语言模型的输入和输出都发生在数字空间里,而机器人每一次感知和动作,都要和真实物理世界直接交互。传感器会有噪声,执行器会有误差,物体的位置、材质和重量也在变化,误差还会在执行过程中不断累积。对具身智能来说,从“基本会做”走到“稳定做对”,可能比最初学会一个任务更难。

王鹤:2028年可能迎来临界点

几乎在同一时间,银河通用创始人兼CTO王鹤也给出了更明确的时间判断。

王鹤表示,随着数据持续积累和技术突破推进,具身智能预计将在2028年迎来“ChatGPT时刻”。他对这一节点的定义是:机器人在没有针对某一项任务进行专项训练的情况下,也能够完成大约70%至80%的日常任务。

从表述上看,王兴兴与王鹤的判断相当接近。前者关注机器人进入陌生环境后的任务完成率,后者更强调基础模型在没有专项训练下的直接泛化能力,但两人都把临界点放在了约70%至80%的未知任务成功率。

王兴兴称具身智能“ChatGPT时刻”未至,行业判断集中在未来2至5年 3

这也意味着,他们所说的“ChatGPT时刻”,并不是当前人形机器人已经展示出的运动能力,也不是某个经过大量训练的固定Demo把成功率做到99%以上。真正的变化,发生在机器人开始摆脱对固定场景、固定物体和专项训练的依赖之后。

WAIC圆桌:6位从业者答案都落在2至5年

一个月前的2026世界人工智能大会(WAIC)上,类似问题也被抛给了6位具身智能领域的创业者和研究者。

7月19日,在由智元机器人和觅蜂科技举办的“智启具身论坛”圆桌环节,主持人请6位嘉宾回答同一个问题:机器人的“ChatGPT时刻”还有几年。

  • 智元机器人合伙人、觅蜂科技董事长兼CEO姚卯青:2年
  • Sunday Robotics联合创始人兼CEO赵子豪(Tony Zhao):3年以内
  • 腾讯首席科学家、Robotics X实验室主任张正友:3至5年
  • Dyna Robotics联合创始人兼首席科学家马也骋:大约4年
  • Physical Intelligence研究科学家任至意:4至5年
  • 佐治亚理工学院教授徐丹飞:5年

这6位来自不同公司和研究机构,技术路线也不一样,但给出的答案全部集中在未来2至5年。

时间判断接近,依据各不相同

在这6人中,姚卯青最为乐观。他的判断主要建立在数据规模增长之上。在他看来,当前制约物理AI继续前进的关键,可以概括为“数据、表征和闭环”三堵墙。

与互联网世界中可低成本获取的大量文本和图片不同,机器人真实交互数据不仅昂贵,还受到机器人本体、任务和场景差异限制。

姚卯青认为,真正能够开箱即用的机器人,需要理解开放式自然语言指令,并在常见任务上达到约70%至80%的基础成功率。要达到这一点,具身智能所需的数据规模将远高于当前水平。他甚至提出,未来可能需要达到“亿小时级别”的数据规模。

按照这一框架,“ChatGPT时刻”很大程度上是一个Scaling问题:真实世界数据、仿真数据、互联网视频、第一视角数据,以及机器人部署后回流的数据逐渐形成规模,模型能力也可能随之跨过临界点。

Sunday Robotics联合创始人兼CEO赵子豪把时间压在3年以内。相比持续追求更复杂的机器人本体,他更关注机器人“大脑”何时真正成熟。Sunday Robotics长期聚焦家庭机器人和基础模型。在他的思路里,如果一个足够强的机器人基础模型能够理解复杂环境和任务,那么即便机器人使用相对简单、成本更低的夹爪,也有机会先解决大量实际问题。

张正友的态度更谨慎。他给出的判断是3至5年,但强调这并不意味着行业只需等待一个更大的模型突然出现。大语言模型之所以能快速形成规模化能力,一个重要前提是Transformer逐渐成为较统一的架构,但机器人智能目前还没有形成这样清晰的技术范式。

从高层认知、视觉感知和任务规划,到实时运动控制、身体反馈和安全反应,机器人要同时处理不同时间尺度的问题。张正友认为,真正的突破可能需要数据采集、仿真、真实部署、失败恢复、硬件和模型一起推进,而不是简单复制大语言模型的Scaling Law。他在给出判断时也强调,行业仍需要“踏踏实实地做”。

马也骋给出的时间是4年左右。他的判断更多来自商业部署视角。对实验室Demo来说,80%或90%的成功率可能已经足以证明技术路线有效;但对真正购买机器人参与工作的工厂或服务企业而言,这样的可靠性通常远远不够。也就是说,具身智能的“ChatGPT时刻”不只是机器人能理解更多任务,还意味着其可靠性要提升到真实商业环境可以接受的水平。

任至意给出的答案是4至5年。他表示,加入Physical Intelligence之前,他一度认为这一过程可能需要10年,但随着过去一年机器人基础模型的发展,他的预期已经明显提前。

Physical Intelligence是当前较有代表性的“机器人基础模型”路线公司之一,其目标是通过跨本体、跨任务的数据训练,让同一个模型逐步获得更广泛的操作能力。在这一逻辑下,关键在于机器人能力能否随着模型和数据规模扩大而持续涌现,最终产生类似大语言模型零样本迁移的效果。

王兴兴称具身智能“ChatGPT时刻”未至,行业判断集中在未来2至5年 4

徐丹飞的答案最保守,但也只有5年。相比押注某一种具体模型路线,他更关注三个更基础的问题:模型能否真正从数据中学习,学到的能力能否泛化到新的环境和任务,以及推理速度能否满足机器人在真实世界中的实时操作要求。

把王兴兴提出的“最快2至3年”、王鹤给出的“2028年”,以及WAIC圆桌6位嘉宾的答案放在一起看,越来越明显的一点是,具身智能行业正在把原本更遥远的“通用机器人”时间表,压缩到未来一个技术周期之内。

“ChatGPT时刻”未必对应单一历史节点

不过,尽管这些创业者和研究者给出的时间越来越接近,他们讨论的其实并不是完全相同的一套标准。

王鹤更关注基础模型本身的能力跃迁。在他的定义里,当机器人不再需要针对每一项新任务重新做专项训练,只凭基础模型就能完成70%至80%的日常任务,具身智能就跨过了一个类似ChatGPT的临界点。这个标准首先衡量的是,模型能否从针对特定任务的“专用智能”,走向具有更强迁移能力的通用智能。

王兴兴提出的标准,则更接近机器人真正进入现实世界后的表现。他同样把约80%的任务完成率视为重要门槛,但更强调机器人进入陌生环境后,能否只依靠语言指令完成大部分任务。在他看来,今天很多机器人已经能在充分训练过的固定环境里达到很高成功率,真正困难的是环境、物体或任务发生变化之后,模型还能不能继续工作。

两种定义看起来相近,关注层次并不完全相同。一个模型即便已经具备不错的零样本能力或跨任务能力,也不代表搭载它的机器人就已经成为可靠的生产工具。

王兴兴在世界机器人大会上提到,宇树实际上已经在汽车工厂以及自己的工厂里部署机器人,也能够完成一些简单的装配任务,但目前仍没有大规模推广。其中一个重要原因是,机器人的效率仍低于人类,同时在面对新任务时往往还需要重新训练。

星海图CEO高继扬则给出了一个双重判断。在本届世界机器人大会展示的产业路线图中,星海图将2027年明确标注为技术层面的“GPT时刻”,认为随着Scaling Law推动基础模型能力跨过拐点,垂直场景应用将开始加速打开;但真正的“商业化拐点”被放在2028年,随后还要经历2029年的深度渗透和2030年的广泛部署。

不过,在谈到具身智能是否会复制ChatGPT式的历史节点时,高继扬又明确表示,他认为“大概率不会有那样一个时刻”。原因是,具身智能不会通过一个面向所有人的软件产品瞬间普及,而更可能从To B场景起步,在一个个行业、一个个任务中逐步解锁。

技术突破和公众感知,也未必会同时发生。GPT的爆发依赖于每个人都能通过手机或电脑亲自体验;而具身智能最先落地的场景更可能是工厂、仓库等生产端,普通公众并不容易直接感知。因此,行业拐点可能会以更缓慢的方式显现,等到大众意识到时,它已经出现在更多地方。

这两种表述并不矛盾。高继扬实际上区分了模型能力的技术拐点和产业扩散的社会拐点:前者可能在某一年相对清晰地出现,后者还需要经过场景验证、规模生产、成本下降和商业模式成熟,才会逐步传导到现实世界。

这也是机器人与大语言模型之间很难忽视的差别之一。2022年11月ChatGPT发布后,模型能力的变化几乎可以在同一天传递给全球用户。对软件产品来说,只要服务器和算力能够承受,新增一个用户的成本相对有限,用户打开网页、输入问题,就能立刻感受到模型能力的跃迁。

机器人则必须通过一个真实的身体进入物理世界。即便某个基础模型明天突然获得更强的泛化能力,这种能力仍要经过芯片、传感器、关节、灵巧手和执行器,才能转化为现实动作,同时还要面对精度、稳定性、安全、寿命、维护和成本等一系列工程问题。

这意味着,具身智能最终未必会复制2022年11月30日那样清晰的历史节点。它更可能表现为一系列逐步出现的临界点。即便未来行业回头确认“具身智能的ChatGPT时刻”已经到来,也未必能找到一个所有人都认可的统一节点。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。