阿拉伯语语音识别一直是个硬骨头。方言多、标注数据少,一个能听懂新闻播报的模型,放到日常对话里可能就抓瞎。阿布扎比的科技创新研究所(TII)发布了Falcon-ASR,一个16亿参数的语音识别模型,专门针对阿拉伯语,尤其侧重阿联酋方言。
先看核心数字:在六个阿拉伯语测试集上,Falcon-ASR的平均词错误率(WER)为20.92%。他们参考的排行榜快照中,此前已公布的最好成绩是23.17%。两者相差2.25个百分点。
![]()
不只是阿拉伯语
这个模型同时支持英语、法语、西班牙语和葡萄牙语。五种语言共用同一套权重,不需要语言标记,输出就是所说话种对应的文字。
在Hugging Face开放语音识别排行榜使用的七个公开英语测试集上,Falcon-ASR的平均WER为5.74%。它还支持词级时间戳,每个转写出来的词都能对应回音频中的位置。
训练数据覆盖了阿联酋方言、现代标准阿拉伯语、其他海湾及阿拉伯方言,以及英语。目标是把人们日常说话中实际用到的词转写出来,包括方言形式和语种切换。
阿联酋方言上的表现
公开评测数据里已经包含阿联酋语音——Casablanca数据集中有一个阿联酋子集。TII在此基础上补充了内部评测,使用留出录音和人工校验的转写文本,评估公开子集之外的阿联酋及海湾语音识别准确率。
在内部阿联酋方言评测中,Falcon-ASR取得了22.73%的WER和10.19%的CER(字符错误率)。在所比较的系统中,这两项指标都是最低的。其WER比排在第二的Qwen3-Omni低了4.07个百分点。
评测条件并不干净。测试音频里加入了背景噪声、重叠语音、音乐、房间混响和电话线路效应,还有语速和音高的变化。阿联酋方言录音也做了同样处理,让模型接触到会议、通话和其他日常录音中可能遇到的各种状况。
排行榜怎么算的
ELM研究中心维护的开放通用阿拉伯语语音识别排行榜,按六个测试集等权平均WER对系统排名,同时报告CER。两项指标都是越低越好。Falcon-ASR的评测遵循这一协议。
评测使用的是排行榜固定的样本清单。竞品数据来自排行榜已公布的平均值,核查日期为2026年9月30日。Falcon-ASR的平均WER比该快照中已公布的最好结果好了2.25个百分点。
阿拉伯语语音因地区、说话人和场景而异。方言阿拉伯语的转写资源比现代标准阿拉伯语少,训练和评测都更难。Falcon-ASR建立在TII此前的Falcon3-Audio工作之上,其架构和训练方法已在相关论文中描述。
目前可以在Hugging Face的Demo Space上试用Falcon-ASR。API访问和原生应用已在计划中。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.