返回说话人追踪

说话人追踪

复旦大学
2026-09-15 12:49:09

复旦大学发布 AVTrack 音视频说话人追踪基准,论文已被 ICML 2026 接收

复旦大学 CVL 实验室发布面向复杂人类中心场景的音视频追踪基准 AVTrack,并公开项目主页、论文、代码与数据集。该基准包含 871 段视频、平均时长 54.0 秒、3,120 条带跨帧身份的像素级实例轨迹,覆盖 8 类可诊断挑战。团队评测显示,现有方法在长期身份关联和音视频不一致场景下仍存在明显短板,其中 AVTracker 在 HOTA 指标上达到 29.08。

350
复旦大学发布 AVTrack 音视频说话人追踪基准,论文已被 ICML 2026 接收