随手先关注,不错过每日AI热讯速递
①
9 月 26 日,印度 AI 公司Sarvam AI在官方博客发布语音识别模型Saaras V4,宣布它在全部22 种印度官方语言上取得SOTA(当前已知最好成绩)表现[1]。
Sarvam 在博客里写:「Saaras V4 achieved SOTA performance on all 22 Indian languages」——也就是说,22 种语言全部做到了已知最好[1]。
架构上,它用音频编码器搭配一个3B参数的混合状态空间语言模型解码器,从零开始自研训练[1]。
同一个模型直出五种转写格式:transcribe(规范文本)、verbatim(逐字保留)、codemix(混写保留英文)、translit(拉丁转写)、translate(英语翻译)[1]。
![]()
图:Saaras V4 官方视觉卡[1]
②
多语言场景最难的其实是「说出来」的杂乱:印英混说、方言差异和背景噪声,Saaras V4 把这三种情况都塞进了同一个解码器处理[1]。
语言识别错误率是2.9%(十大语言)与5.22%(全部 22 种),Sarvam 给出的口径是同级最好[1]。
英语侧,它在七个全球英语数据集上取得最低平均WER(词错误率,衡量转写结果与原文差了多少),其中六个是外语口音数据集、一个是印度英语[1]。
![]()
图:Saaras V4 主题封面[2]
③
新加入的keyterm prompting(调用时传入专有名词列表,引导模型优先识别这些词)最多支持50 个术语、每个 64 字符,解决品牌名必须保持拉丁书写的问题[2]。
在 IndicContextEval 基准的 L5 关键词设置下,Sarvam 报告16.03%的词错误率,并称这是该基准的最低成绩[2]。
流式接口的首包时间低于150ms,适合实时字幕与语音助手这类场景;服务按小时计费,权重则暂未开放[2]。
④
全部 WER 与错误率数字均为厂商自报口径,测试集多为自有数据集,独立的第三方复现结果尚未出现[1][2]。
部署形态也有取舍:V4 仅提供 API,自托管文档目前只覆盖上一代 v3——「开放」标签只兑现了一半[2]。
对中国读者的参考价值在于工程范式:把五种输出形态收进同一个模型,砍掉后处理链条的误差累积——这条思路对多方言、多脚本场景同样成立[1]。
从「22 种语言一个模型」出发,多语言语音的下一步会卷什么?评论区聊聊你的看法。
参考来源:
[1] Introducing Saaras V4 | Sarvam AI Bloghttps://www.sarvam.ai/blogs/introducing-saaras-v4
[2] Sarvam AI Releases Saaras V4: A Speech-to-Text Model for All 22 Indian Languages and Global Englishhttps://www.marktechpost.com/2026/09/26/sarvam-ai-releases-saaras-v4-a-speech-to-text-model-for-all-22-indian-languages-and-global-english/
欢迎点赞、分享、推荐
一起拥抱AI
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.