MemoBench 揭开世界模型短板:10 款视频模型物体重现得分均未超 0.6

MemoBench 揭开世界模型短板:10 款视频模型物体重现得分均未超 0.6

N
News Editor
2026-07-06 06:44:26
哈佛、MIT、IBM、谷歌等机构研究者推出世界模型评测基准 MemoBench,首次系统检验动态遮挡场景下的“物体恒存”能力。该基准基于 360 段合成与真实视频,评估 10 个主流视频生成模型在物体身份维持、状态推演与记忆连续性方面的表现。结果显示,所有模型的物体重现得分均低于 0.6,说明当前模型即使画面连贯,也难以在目标离开视野后正确恢复其状态。
世界模型视频生成MemoBench人工智能ECCV 2026计算机视觉模型评测

哈佛大学、MIT、IBM、波士顿大学、谷歌、JHU、CMU 与 Kempner Institute 的研究者联合提出了新的世界模型评测基准 MemoBench,用于检验视频生成模型在动态遮挡环境中的“物体恒存”能力。论文已被 ECCV 2026 接收,核心问题是:当目标物体离开视野后继续发生变化,模型能否记住它的身份、推演状态,并在重现时准确还原。

MemoBench 揭开世界模型短板:10 款视频模型物体重现得分均未超 0.6 2

研究团队指出,现有视频生成基准大多只评估物体持续可见时的帧间一致性,少数包含遮挡的测试也多停留在静态场景,无法真正衡量模型对动态世界的记忆与更新能力。MemoBench 试图补上这一空白,并给出一个可量化、可对比的诊断标尺。

V-D-R 三段式评测设计

MemoBench 采用 Visible–Disappear–Reappear(可见—消失—重现,V-D-R)范式。每个样本都包含三个阶段:首先目标物体在镜头内可见,并持续经历物理变化;随后相机平移、转头或 U 型转弯,使目标完全离开视野;最后镜头返回原区域,要求模型恢复目标在消失期间自然演化后的状态,而不是简单复原初始外观。

MemoBench 揭开世界模型短板:10 款视频模型物体重现得分均未超 0.6 3

这一设计考验的不只是逐帧生成能力,而是模型是否在视野外维持了持续演化的世界状态。研究者认为,这比传统画面连贯性测试更接近世界模型的核心能力,也更能区分“生成合理画面”和“真正理解物理过程”之间的差异。

360 段视频覆盖合成与真实场景

数据集共包含 360 段 1920×1080 的 Ground-truth 视频,其中 196 段为 Unreal Engine 5 渲染的合成场景,覆盖 5 大类环境和 14 个子场景,并附带逐帧 RGB、深度图、相机内参与相机位姿,用于精确评估大视角变化下的空间记忆。另有 164 段真实世界视频,在受控室内环境拍摄,覆盖 7 大类、30 种物理状态变化过程,包括溶解、燃烧、扩散吸收、化学反应、粘性流动、泡沫演化和力学形变。

MemoBench 揭开世界模型短板:10 款视频模型物体重现得分均未超 0.6 4

所有样本均经过人工标注,精确标出目标“完全消失”和“完全重现”的关键帧,作为 V、D、R 三阶段的划分依据。研究团队还配套了自动化评估工具与语义化 VQA 流程,以同时覆盖底层像素保真和高层语义正确性。

自动化指标与 VQA 双线打分

自动化评测包括通用视频质量、记忆专属指标和提示保真度三部分。核心记忆指标是物体重现分数 ORS,通过 SAM-3 文本驱动分割模型检测重现阶段目标物体的存在性与置信度,直接衡量目标能否“正确回来”。同时,评估还纳入 PSNR、SSIM、LPIPS 以及相机可控性等指标,用于定位性能退化发生在哪个阶段。

MemoBench 揭开世界模型短板:10 款视频模型物体重现得分均未超 0.6 5

VQA 语义评估则覆盖四个维度:指令遵循、物体与背景一致性、记忆连续性以及物理合理性。研究者表示,问题集合经过真值过滤、失败案例过滤和人工交叉验证三轮筛选,最终人工与视觉语言模型判断的一致性达到 92.9%,Cohen's κ 系数为 0.85

10 个主流模型全部未通过记忆测试

研究团队在 MemoBench 上测试了 10 个主流世界生成模型,覆盖相机可控图生视频(CI2V)、显式 3D 视角合成和普通图生视频(I2V)三类路线。结果显示,没有任何模型能可靠完成“消失—重现”任务,所有模型的 ORS 均未超过 0.6。在真正执行相机轨迹、让物体实际离开画面的模型中,“记忆连续性”语义得分最高也只有 55.6 分;LTX-Video 虽达到 57.0,但被指出因相机几乎不动而存在虚高。

研究者将常见失败归纳为六类:物体直接消失、身份漂移、状态重置、位置跳变、背景幻觉和相机轨迹漂移。其中,合成场景最常见的问题是背景幻觉,真实场景则更常见身份漂移。团队据此认为,现有模型即使能够生成视觉上连贯的视频,也普遍无法在目标重现时恢复其在遮挡期间应有的真实状态。

MemoBench 揭开世界模型短板:10 款视频模型物体重现得分均未超 0.6 6

几组对照揭示当前路线分化

MemoBench 还揭示了几组有代表性的对照结果。首先,普通 I2V 模型 LTX-Video 虽然在运动平滑度、3D 几何一致性和物体身份一致性等指标上排名靠前,但原因并非记忆能力强,而是其相机几乎不移动,目标始终停留在画面内,从而绕开了“物体消失”这一核心挑战。对应地,它在相机可控性和指令遵循上的得分处于末档。

其次,支持相机控制并不意味着具备更好的记忆能力。五个 CI2V 模型的 ORS 从 0.266 到 0.582 不等,跨度超过一倍。HunyuanWorldPlay 以 0.582 领跑 CI2V 阵营,而 HunyuanGameCraft 与 FantasyWorld 分别仅为 0.266 和 0.276,且后两者的视觉画质评分反而更高。这说明“镜头能按轨迹移动”和“模型能记住先前世界状态”是两回事。

MemoBench 揭开世界模型短板:10 款视频模型物体重现得分均未超 0.6 7

在 3D 路线中,Stable Virtual Camera 具备最精准的相机轨迹控制和较高像素保真,但视觉质量偏低,容易出现模糊边缘和深度修补错误;Matrix-Game 2.0 则画面锐利、视觉质量高,却常发生相机路径偏移。研究团队认为,这说明几何精确性与画面自然度在当前框架下仍未对齐,单一指标不足以反映真实世界建模水平。

给首帧条件比单纯扩参更有效

论文还披露了一项针对 Wan2.2 的消融实验。研究者一组将模型参数量从 5B 扩大到 14B,另一组则在维持 5B 参数不变的前提下,额外输入“可见阶段的第一帧”作为图像条件。结果显示,加入首帧条件后,PSNR 提升约 4.2 dB,LPIPS 下降 0.20;相比之下,参数扩大近三倍带来的改进非常有限。

MemoBench 揭开世界模型短板:10 款视频模型物体重现得分均未超 0.6 8

这一结果表明,相比单纯扩大模型规模,如何编码并保持目标的初始状态,可能更直接影响记忆任务表现。研究团队据此认为,显式建模持久状态表征、围绕记忆设计训练目标,以及强化对初始状态的感知,或将成为下一代世界模型的重要改进方向。

目前,论文、代码、数据集与公开榜单均已开源。论文题为《MemoBench: Benchmarking World Modeling in Dynamically Changing Environments》,论文地址为 https://arxiv.org/abs/2606.27537,项目主页为 https://memobench-team.github.io/,代码仓库为 https://github.com/MemoBench-Team/MemoBench,数据集已上线 Hugging Face。对视频生成与具身智能方向的研究者而言,MemoBench 提供了一个更接近真实世界约束的新评测基线。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。