谷歌DeepMind于4月14日发布了面向机器人场景的高阶推理模型Gemini Robotics-ER 1.6。根据公开信息,该模型在空间推理、多视角理解以及工业仪表读取等方面较前代版本实现了明显增强,并已通过Gemini API和Google AI Studio向开发者开放。这一更新显示出生成式AI正加速从通用对话、内容生成走向更复杂的物理世界任务执行。
核心升级聚焦机器人感知与推理
从功能层面看,Gemini Robotics-ER 1.6此次升级主要集中在三个方向。首先是指向与定位精度提升。新模型能够更准确地完成目标检测、物体计数、空间关系判断以及运动轨迹规划,同时还能对画面中并不存在的物体引用做出拒绝,从而降低机器人在复杂环境中出现误判的概率。
其次是多视角检测能力增强。在工业、仓储或巡检场景中,机器人往往需要结合多个摄像头输入来判断任务是否完成。Gemini Robotics-ER 1.6能够整合多路视觉信息,即便在目标被遮挡或现场环境动态变化的情况下,仍尽量保持识别准确性。这意味着机器人在真实生产环境中的可用性和稳定性有望进一步提高。
第三项值得关注的能力,是新增的工业仪表读取。DeepMind表示,该模型能够通过具备步骤化推理的视觉代理能力,识别并解释圆形压力表、垂直液位指示器以及数字显示屏等工业设备数据。对于需要频繁巡检的工厂、能源设施和物流中心而言,这类能力直接对应了机器人商业落地中的高价值任务。
波士顿动力接入,Spot进入自主读表阶段
在产业合作方面,DeepMind与波士顿动力的联动成为此次发布的一大亮点。波士顿动力宣布,已将Gemini与Gemini Robotics-ER 1.6整合进其Orbit AIVI-Learning产品中,并于4月8日面向全部AIVI-Learning客户上线相关功能。借助这一集成,四足机器人Spot如今能够在工业设施中执行自主巡检任务,并读取包括压力表在内的各类仪表数据。
这意味着Spot的角色正在从“移动巡检终端”进一步升级为“具备理解与判断能力的智能执行体”。过去,机器人巡检往往依赖预设规则、固定模板或人工复核;而随着大模型推理能力被引入,机器人有望在更多半结构化、复杂场景中自主完成感知、识别和反馈流程。
波士顿动力还表示,在Gemini推理能力加持下,AIVI-Learning在视觉检查、托盘计数和液体检测等任务上的基线表现与准确率均有所改善。虽然官方未披露更详细的量化指标,但从应用方向来看,相关能力已经覆盖工业自动化中多个典型场景。
安全性表现成为关键竞争点
对于机器人模型而言,性能提升之外,安全性同样是商业落地的核心门槛。DeepMind称,Gemini Robotics-ER 1.6是其“最安全的机器人模型”,在对抗性空间推理任务中,相较ER 1.5表现出更强的安全指令遵循能力。与此同时,在基于真实伤害报告构建的安全风险识别测试中,ER系列模型相较Gemini 3.0 Flash在文本场景中高出6%,在视频场景中高出10%。
这一数据释放出两个信号:其一,机器人AI的竞争已不再只是“看得更准、做得更快”,而是开始转向“在高风险场景下能否更稳、更安全”;其二,面向物理世界部署的AI模型,未来可能会比纯软件场景更强调规则遵循、异常识别和风险预判能力。
市场影响:AI与机器人融合加速,跨行业叙事延伸至加密领域
从市场角度看,Gemini Robotics-ER 1.6的发布再次强化了“AI+机器人”这一技术主线。当前,全球科技产业正将大模型能力从云端知识处理延伸至终端设备、智能制造和工业自动化,而机器人正是最具代表性的落地载体之一。DeepMind与波士顿动力的合作,说明头部AI公司与机器人厂商之间的协同正在加深,未来相关生态有望吸引更多开发者、工业客户和资本关注。
对于加密市场参与者而言,这类消息虽然并不直接对应某一加密资产价格波动,但会持续推动“AI+Crypto”叙事升温。原因在于,机器人、边缘计算、数据采集、模型调用和机器协作等环节,长期被视为可能与去中心化计算、数据市场、机器身份认证及链上激励机制结合的方向。随着现实世界AI应用持续扩展,市场对相关基础设施型加密项目的关注度也可能随之上升。
不过,需要注意的是,当前这类产业进展更多体现为技术趋势和生态想象空间,距离形成大规模、可验证的链上商业闭环仍有距离。对投资者而言,更值得关注的是技术落地节奏、企业客户采用情况,以及AI能力是否能真正转化为稳定的商业收入,而非仅停留在概念推动阶段。
整体来看,Gemini Robotics-ER 1.6的推出,不仅代表谷歌DeepMind在机器人推理模型上的又一次推进,也显示出工业巡检、设备读表和多视角环境理解正成为机器人AI竞争的新焦点。随着Spot等机器人开始具备更强的自主判断能力,AI从数字世界走向物理世界的趋势正在进一步加速。

