Meta 已将视觉分割模型 SAM 3.1 正式接入 Model API。开发者传入图片或视频后,再输入「红色自行车」这类短语,就可以直接定位对应物体,并返回边界框和像素级蒙版。
在视频场景中,API 还支持持续跟踪同一个目标,可用于自动打码、添加特效等用途。
Meta 在今年 3 月已经发布 SAM 3.1 的开放权重版本。和 SAM 3 相比,SAM 3.1 最大的升级是 Object Multiplex。此前多个目标需要逐个处理,现在一次最多可同时处理 16 个目标。
按照 Meta 的测试结果,单张 H100 在处理多目标视频时,速度从每秒 16 帧提升到 32 帧;在追踪 128 个目标时,速度约为 SAM 3 的 7 倍。
此前,开发者需要自行下载权重,并准备 GPU 和部署环境;现在则可以直接调用 Meta 托管的 API。价格方面,图片分割每 1000 张收费 2.5 美元,视频每 1000 帧收费 0.2 美元,也支持通过 OpenAI SDK 接入。
不过,API 版本目前只接受文字提示;开放权重版本还支持通过框、点等视觉提示指定目标。视频 API 每帧最多可追踪 16 个物体。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

