阿里巴巴Qwen团队周二发布了Qwen-Robot Suite,一套由三个基础模型组成的具身智能全栈。Qwen-RobotNav负责移动导航,Qwen-RobotManip负责机械操控,Qwen-RobotWorld负责物理世界模拟。三个模型各自独立,合在一起则构成了机器人领域的“Android时刻”——它是操作系统,而非硬件。
Qwen-RobotNav:五合一导航模型
导航模型整合了指令跟随、目标点导航、物体搜索、目标追踪和自主驾驶五项任务,每项任务需要不同的视觉记忆策略。多数模型只锁定单一策略,Qwen-RobotNav则提供可参数化的接口:token预算、时间衰减、每镜头权重,规划器可在执行中重新配置。该模型在1,560万笔样本上训练,在VLN-CE RxR基准测试(真实环境的视觉与语言导航)中成功率达到76.5%,在EVT-Bench(移动目标追踪)上达到90%。
Qwen-RobotManip:跨机器人操控
不同机器人的动作表示方式截然不同:Franka机械臂使用关节角度,ALOHA双臂机器人使用夹爪位置和方向,人形机器人则使用全身坐标。阿里巴巴从开源机器人数据库和人类视频中合成了约38,100小时的训练数据,没有依赖私有数据收集。模型在RoboChallenge Table30-v1基准测试中排名第一,超越先前方法20%。
Qwen-RobotWorld:语言即通用接口
这是最雄心勃勃的模型——一个以语言为条件的视频世界模型,将自然语言作为通用动作接口。“拿起红色杯子往花上倒水”这个指令,无论对夹爪、自驾车还是移动导航代理都通用。具身世界知识语料库涵盖860万笔视频文字配对、2亿帧,横跨操控(590万笔样本、1300+技能、20+形态)、自主驾驶(Waymo、NVIDIA PhysicalAI-AD)、室内导航和跨14种机械臂的人机转移。模型在EWMBench和DreamGen Bench两项基准测试中排名第一,在牛顿定律、质量守恒、流体动力学和重力等物理一致性测试中获得满分。
与西方实验室的对比
Google DeepMind、Nvidia、Figure和Physical Intelligence等西方实验室也在追求类似目标,但大多专注于导航或操控,而非统一可组装的套件。阿里巴巴从芯片到应用的垂直整合意味着它掌控了完整生态链,且这些模型全部开源。不过开发者提醒,这些是软件模型而非实体机器人,实际部署在家用场景仍需数年时间。阿里巴巴目前尚未公布定价、时间表或试点计划之外的客户名单。

