Reka发布 190 亿参数 Rho-1,可统一处理图文视频与机器人动作

Reka发布 190 亿参数 Rho-1,可统一处理图文视频与机器人动作

N
News Editor
2026-10-06 12:56:20
由前 DeepMind、Google Brain 和 Meta FAIR 研究人员创办的美国 AI 公司 Reka 发布 190 亿参数模型 Rho-1。该模型可在单次对话中处理文字、图片、视频,并输出机器人动作信号,支持在视频生成过程中继续接收修改指令。基础版生成速度约为实时的 0.79 倍,蒸馏版可在约 1 秒生成 5.3 秒视频。目前项目仍处于研究预览阶段,权重和 API 尚未开放。

由前 DeepMind、Google Brain 和 Meta FAIR 研究人员创办的美国 AI 公司 Reka 发布 190 亿参数模型 Rho-1。该模型可在一次对话中同时处理文字、图片和视频,并输出机器人动作。

按照官方展示,Rho-1 可以先生成一张灯塔图片,再让灯塔动起来、修改视频中的天气,随后继续回答两段视频之间的区别。前面生成的内容会保留在同一上下文中,不需要再交给另一个模型处理。

支持在生成过程中继续修改视频

Rho-1 还支持在视频生成过程中继续接收指令。视频向前生成时,用户可以临时要求改变天气、运动方向或其他内容,后续画面会继续按新指令调整。

基础版生成速度约为实时的 0.79 倍。蒸馏版则将生成步骤从 99 步压缩到 8 步,Reka 测得其约 1 秒可以生成 5.3 秒视频。

机器人动作也接入同一模型

在机器人任务上,Rho-1 一边预测摄像头接下来会看到什么,一边输出机器人的动作信号,不再需要单独的规划模型决定如何移动。当前官方展示仍限于 LIBERO 仿真任务,尚未公布实体机器人的测试结果。

定位偏向连续交互

类似的统一模型今年已经出现。英伟达 Cosmos 3 也可以统一处理文字、图片、视频、声音和动作。相比之下,Rho-1 更偏向连续交互,重点展示同一上下文内的反复生成、修改和继续推理。

仍处研究预览阶段

Reka 表示,Rho-1 从零训练,使用 320 张 H100,训练时间约 3 个月。当前视频分辨率为 672×384,长视频仍可能出现画面结构漂移,视频定位和局部编辑也不够稳定。

目前,Rho-1 仍处于研究预览阶段,权重和 API 都未开放。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。