Sarvam AI 推出 Saaras V4,支持 22 种印度语言语音转文本

Sarvam AI 推出 Saaras V4,支持 22 种印度语言语音转文本

N
News Editor
2026-09-26 22:04:57
印度 AI 公司 Sarvam AI 发布新一代语音识别模型 Saaras V4,覆盖 22 种印度官方语言及全球英语口音,并通过 API 提供服务。该模型支持实时流式转录、批量处理和说话人分离,实时转录定价为每小时 30 印度卢比。Sarvam AI 称,Saaras V4 在多项基准测试中表现最佳,在嘈杂音频数据集上的错误率低于 Deepgram Nova-3 和 GPT-4o Transcribe,但相关结果仍缺乏独立复现。

Techub News 消息,印度 AI 公司 Sarvam AI 发布新一代语音识别模型 Saaras V4,覆盖全部 22 种印度官方语言及全球英语口音。

该模型通过 API 提供,支持实时流式转录、批量处理及说话人分离功能,实时转录价格为每小时 30 印度卢比。

Saaras V4 的模型结构与输出模式

Saaras V4 采用编码器-解码器架构,解码器基于 Sarvam AI 自研的 30 亿参数混合状态空间语言模型 Sarvam-3B。

模型提供 5 种输出模式,包括转录、逐字记录、代码混合、拉丁化转写及翻译,并新增关键词提示功能,用于提升特定术语的识别准确率。

厂商披露的基准测试结果

Sarvam AI 表示,Saaras V4 在多项基准测试中取得最优结果,在嘈杂音频数据集上的错误率低于 Deepgram Nova-3 和 GPT-4o Transcribe。

不过,这些数据均由厂商自行报告,目前尚未有独立复现结果发布。

消息来自 MarkTechPost。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。