复旦大学发布 AVTrack 音视频说话人追踪基准,论文已被 ICML 2026 接收

复旦大学发布 AVTrack 音视频说话人追踪基准,论文已被 ICML 2026 接收

N
News Editor
2026-09-15 12:49:09
复旦大学 CVL 实验室发布面向复杂人类中心场景的音视频追踪基准 AVTrack,并公开项目主页、论文、代码与数据集。该基准包含 871 段视频、平均时长 54.0 秒、3,120 条带跨帧身份的像素级实例轨迹,覆盖 8 类可诊断挑战。团队评测显示,现有方法在长期身份关联和音视频不一致场景下仍存在明显短板,其中 AVTracker 在 HOTA 指标上达到 29.08。

复旦大学 CVL 实验室发布了一个面向复杂人类中心场景的音视频追踪基准 AVTrack,相关论文已被 ICML 2026 接收,项目主页、论文、代码和数据集已公开。

复旦大学发布 AVTrack 音视频说话人追踪基准,论文已被 ICML 2026 接收 2

音视频说话人追踪(Audio-Visual Speaker Tracking)的目标,是让模型同时利用声音和画面,定位并持续追踪正在发声的人。它对应的应用场景包括多人线上会议中的自动聚焦、综艺素材中的说话人识别与字幕生成,以及监控视频中对发声者的持续跟踪。

AVTrack 关注的不只是说话人检测

研究团队指出,音视频追踪并不只是判断「谁在说话」。给定一段带声音的视频,模型还需要在视频持续变化以及多个发声片段之间,保持稳定的实例身份。

在真实视频场景里,人物可能相互遮挡、频繁移动和交替发声,镜头也可能不断切换,还可能出现画外音等音视频不一致情况。AVTrack面向的正是这类复杂场景。

这一基准要求模型联合理解声音和画面,为每个正在发声的人生成像素级掩码,并在视频变化过程中保持稳定的实例身份。换句话说,模型不仅要知道「声音来自谁」,还要持续判断「这个人是谁、在哪里」。

复旦大学发布 AVTrack 音视频说话人追踪基准,论文已被 ICML 2026 接收 3

围绕这一任务,模型需要同时回答三个问题:

  • 谁在发声:即从音频中判断当前活跃的说话者;
  • 人在哪里:即在每一帧中以像素级精度分割对应人物;
  • 前后还是同一个人吗:即使人物被遮挡、镜头切换或位置互换,也要维持跨帧身份一致性。

研究团队认为,第三个问题尤其关键。仅依靠单帧外观或嘴部运动,模型或许能暂时找到说话者;但在长视频中持续维持正确身份,还必须处理视觉遮挡、多人轮流发声和音画不一致等情况。

现有评测基准覆盖不足,复杂动态场景缺少压力测试

文章提到,早期音视频说话人跟踪数据集大多来自受控实验室环境,人物数量较少,摄像机和麦克风位置也相对固定。在这种简单场景中,模型即便没有真正理解时序动态和跨模态推理,也可能凭借声音和画面同时出现的静态关联取得不错成绩。

后续音视频分割(AVS)和音视频实例分割(AVIS)任务虽已获得较多关注,也取得了显著进展,但已有基准仍难完整回答一个基础问题:当场景变得动态、拥挤且不连续时,模型的音频—视觉对应与长期身份关联能力究竟如何。

例如,后续音视频分割基准虽然引入了像素级标注和更自然的视频来源,但许多样本仍是 5–10 秒的短片,难以充分检验长期时序建模。AVISeg 将视频长度扩展到平均约 60 秒,并提供实例级分割与跟踪标注,但在镜头运动、遮挡、背景切换和相对位置变化上的覆盖仍有限。

复旦大学发布 AVTrack 音视频说话人追踪基准,论文已被 ICML 2026 接收 4

这也带来一个评测盲点:模型可能在相对静态的视频中拿到不错结果,却仍依赖短时音视频共现关系。一旦人物消失后重现、镜头切换,或者声音与画面中最显眼的人并不一致,已有评测基准很难完整检验模型是否真正维持了跨模态对应关系。

AVTrack 由 871 段视频构成,覆盖 8 类可诊断挑战

AVTrack 包含 871 段视频,平均时长 54.0 秒,共提供 3,120 条带跨帧身份的像素级实例轨迹。数据覆盖剧集、vlog、动画、真人秀、访谈和舞台表演 6 类来源。

与常规训练集不同,AVTrack 被设计为纯测试基准。作为独立测试集,它用于观察模型能否迁移到复杂的人类中心场景。

为了系统分析复杂场景中的关键困难,研究团队将 AVTrack 划分为 8 类可诊断挑战:

  1. 视觉遮挡(Visual Occlusion):发声者被其他人物或物体部分遮挡,造成实例重叠和视觉边界模糊。该属性覆盖 AVTrack 80.9% 的样本,而 AVISeg 中仅为 8.6%。
  2. 相对位置变化(Relative Position Change):多个实例之间的相对空间关系随时间变化,例如发声者从另一人物左侧移动到右侧。AVTrack 中该属性占 70.7%,AVISeg 中为 9.7%。
  3. 背景切换(Background Switch):视频中出现明显场景或背景变化,例如由室内切换到室外。该属性在 AVTrack 和 AVISeg 中分别占 60.5% 和 5.9%。
  4. 相机运动变化(Camera Motion Change):相机视角发生显著变化,包括推拉、摇移、视角变化或镜头切换。这是 AVTrack 中最常见的挑战,覆盖 90.5% 的样本,而 AVISeg 中仅为 7.1%。
  5. 多实例(Multiple Instances):画面中同时存在多个候选人物,但只有部分实例正在发声,要求模型建立正确的音视频对应关系。AVTrack 中该属性占 64.9%,AVISeg 中为 13.6%。
  6. 多轮发声(Multi-turn Sounding):不同人物随时间交替发声,要求模型动态更新目标身份。该属性覆盖 AVTrack 56.8% 的样本,AVISeg 中为 16.0%。
  7. 音视频不一致(Audio-Visual Inconsistency):音频与当前可见人物之间不存在直接一一对应关系,例如旁白、画外音或发声者暂时不在画面中。AVTrack 中约 9.2% 的样本包含此类情况。
  8. 实例尺度动态变化(Instance Scale Dynamics):目标实例在视频中呈现显著尺度差异,或随时间发生大幅尺度变化。该属性在 AVTrack 中占 56.9%,AVISeg 中为 35.3%。

研究团队表示,这些属性不仅用于刻画数据集的场景复杂度,也可进一步分析模型的具体失效模式。就动态视觉变化而言,AVTrack 明显比 AVISeg 更具挑战性:90.5% 的视频包含相机运动变化,80.9% 包含视觉遮挡,70.7% 包含相对位置变化,显著高于 AVISeg 的 7.1%、8.6% 和 9.7%。与此同时,AVTrack 还显式覆盖音视频不一致等传统音视频分割数据较少涉及的场景。

复旦大学发布 AVTrack 音视频说话人追踪基准,论文已被 ICML 2026 接收 5

在数据构建流程上,标注人员先从约 1,300 段公开视频中筛选候选样本,利用 Grounded-SAM 进行自动预标注,再由标注人员逐帧修正并检查时序身份。整个数据收集、标注和验证过程持续近三个月,共有 15 名专业标注人员参与。

现有方法在 AVTrack 上整体表现有限

研究团队在统一设置下评估了代表性的视频实例分割(Video Instance Segmentation,VIS)和音视频实例分割方法。

其中,VIS 方法先在 YouTube-VIS 上预训练,再在 AVISeg 上微调;AVIS 方法则在 AVISeg 上训练,最终都直接在 AVTrack 上测试。

结果显示,只使用视觉信息的 VITA、LBVQ 和 CAVIS,在 AVTrack 上的 HOTA 测试指标均低于 12。加入音频信息后,AVISM 和 ACVIS 分别达到 20.84 和 20.60,表明音频辅助能够带来明显帮助,但长期身份关联仍然困难。

研究团队还给出两个互补基线。端到端方法 AVTrackFormer 的 HOTA 测试指标为 21.47;无需训练的模块化模型 AVTracker 则达到 29.08。

复旦大学发布 AVTrack 音视频说话人追踪基准,论文已被 ICML 2026 接收 6

与已有 AVIS 方法中表现最好的 AVISM 相比,AVTracker 提升了 8.24(29.08 vs. 20.84);与更强的端到端基线模型 AVTrackFormer 相比,AVTracker 提升了 7.61(29.08 vs. 21.47)。

团队还测试了 Gemini 2.5 Pro 的零样本表现。直接输入 1 FPS 的视频帧和原始音频后,其 HOTA 指标为 14.4。论文据此指出,通用 Omni-LLM 的广泛音视理解能力,还不能直接转化为复杂场景下稳定的像素级说话人跟踪能力。

AVTracker 将长视频问题拆成三步处理

AVTracker 的核心思路,是把长视频中的复杂关联问题拆分为三个阶段。

第一步,系统使用 Whisper 获取带时间戳的语音片段,并基于 EC APA-TDNN speaker embedding 合并相邻且属于同一说话者的片段,形成更紧凑的说话人片段。

第二步,在每个局部时间窗口内,SAM3 提供人物候选掩码,Local Reasoner 联合语音转写和视觉观测,将当前语音片段对应到可见人物,并形成局部短轨迹。

复旦大学发布 AVTrack 音视频说话人追踪基准,论文已被 ICML 2026 接收 7

第三步,Global Reasoner 汇总各个局部轨迹的关键帧,在整段视频上完成身份分组,恢复连续的说话人轨迹。

消融实验显示局部到整体设计有效,但难点仍未消除

消融实验验证了这种从局部到整体的设计有效性。在相同模型设置下,移除局部片段压缩后,HOTA 从 24.01 降至 16.88;在完整模型上关闭动态窗口机制后,HOTA 也从 28.85 降至 27.45。

研究团队还发现,语音分离并不总能带来性能提升。采用 MossFormer2 时,HOTA 从 28.85 提升到 29.08;采用 SepFormer 时,HOTA 反而下降到 28.41。这说明语音分离阶段产生的误差,可能会继续传递到后续音视频对齐过程中。

音视频不一致仍是最难场景

从细分类别结果看,音视频不一致仍是所有方法面临的最困难场景,AVTracker 在这一场景下的 HOTA 也只有 18.5。

论文还提到,在视觉遮挡和多实例场景中,当距离较近的说话人被遮挡且频繁交替发声时,全局推理器仍可能错误合并不同身份,或把同一身份拆分为多条轨迹。

复旦大学发布 AVTrack 音视频说话人追踪基准,论文已被 ICML 2026 接收 8

这些失效模式表明,长期记忆、跨窗口证据累积,以及可修正的身份推理机制,仍是后续研究的重要方向。研究团队表示,后续工作将继续关注音视频不一致、实例尺度动态变化等困难场景,同时探索记忆增强跟踪、基于反思的错误修正机制,以及更高效的数据与模型设计。

项目已公开

随着 AVTrack 正式发布,研究团队希望借此更深入分析模型在复杂音视融合场景中的性能表现和能力短板。其关注的核心问题是,模型究竟只是在静态画面里找到了「看起来像说话者的人」,还是已经学会在动态世界中持续理解「谁在何时、何处发声」。

目前,项目主页、论文、代码和数据集均已开放:

  • 项目主页:https://fudancvl.github.io/AVTrack/
  • 论文:https://arxiv.org/abs/2606.02724
  • 代码:https://github.com/FudanCVL/AVTrack
  • 数据集:https://huggingface.co/datasets/FudanCVL/AVTrack

本文原始信息显示,该内容来自微信公众号「新智元」,作者为 LRST。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
3500

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。