Meta
2026-09-19 03:06:15Meta将 SAM 3.1 接入 API,图片分割每千张收费 2.5 美元
Meta 已将视觉分割模型 SAM 3.1 正式接入 Model API。开发者上传图片或视频,并输入类似「红色自行车」的文字提示后,系统可返回对应目标的边界框和像素级蒙版,视频中还支持持续跟踪同一目标。与 SAM 3 相比,SAM 3.1 新增 Object Multiplex,单次最多可同时处理 16 个目标,视频处理速度和多目标追踪效率也有所提升。
170

Meta 已将视觉分割模型 SAM 3.1 正式接入 Model API。开发者上传图片或视频,并输入类似「红色自行车」的文字提示后,系统可返回对应目标的边界框和像素级蒙版,视频中还支持持续跟踪同一目标。与 SAM 3 相比,SAM 3.1 新增 Object Multiplex,单次最多可同时处理 16 个目标,视频处理速度和多目标追踪效率也有所提升。

复旦大学 CVL 实验室发布面向复杂人类中心场景的音视频追踪基准 AVTrack,并公开项目主页、论文、代码与数据集。该基准包含 871 段视频、平均时长 54.0 秒、3,120 条带跨帧身份的像素级实例轨迹,覆盖 8 类可诊断挑战。团队评测显示,现有方法在长期身份关联和音视频不一致场景下仍存在明显短板,其中 AVTracker 在 HOTA 指标上达到 29.08。
