英伟达宣布发布Cosmos-Reason2-32B模型权重,这是一款面向机器人与自动驾驶系统的物理感知型视觉语言推理模型。该模型此前已推出较小版本,如今旗舰版320亿参数正式可供商业使用,并采用NVIDIA Open Model License授权开放。
聚焦机器人与自动驾驶应用
根据披露信息,Cosmos-Reason2-32B建立在Qwen3-VL-32B-Instruct基础之上,重点服务于对现实环境理解要求较高的工业与交通场景。模型能够实时分析驾驶视频,也可以对仓库照片中的2D/3D坐标进行标注,这意味着其不仅适用于道路环境识别,也可用于工业物流、仓储自动化等任务。
在具体应用层面,该模型被定位为城市和工业环境视频流分析工具,可用于传感器数据标注,并可充当机器人及自动驾驶车辆的“规划大脑”。这一定位表明,英伟达正试图将视觉理解、时序推理与任务规划整合进同一模型框架,以提升具身智能系统的整体决策能力。
关键能力较此前版本提升
从功能升级来看,Cosmos-Reason2-32B在目标检测、精确时间戳定位以及上下文处理能力方面均有增强。尤其是其上下文窗口扩展至256K tokens,这为处理更长的视频片段、复杂场景描述及多模态推理任务提供了更大空间。对于需要持续感知与长时序决策的自动驾驶和机器人系统而言,更长上下文通常意味着更强的环境连贯理解能力。
整体来看,英伟达此次开放旗舰模型商用,进一步强化了其在AI基础设施之外向应用层延伸的布局。随着机器人和自动驾驶行业对高精度视觉推理模型的需求上升,Cosmos-Reason2-32B有望成为相关开发者与企业测试和部署新一代智能系统的重要工具之一。

