谁能想到,那个你考四六级时天天开着查单词的网易有道,最近干了件让全球开源社区炸锅的大事。就在刚过去的一周,Hugging Face 的语音识别、翻译两大核心赛道热榜,直接被这个中国团队屠了榜。有道刚发布才 5 天的开源模型 R2T2、T3PO,硬生生把 OpenAI、谷歌、英伟达这些国际大厂的产品全挤到身后,双双拿下两个榜单的第一。
语音识别榜里,OpenAI 压箱底的大杀器 Whisper-large-v3 只排到第六,英伟达的 Nemotron 更是掉到第八;翻译榜更夸张,谷歌、Meta 这些在翻译领域深耕十几年的老牌玩家,连前几名都没捞着。这种把国际大厂集体按在榜尾的阵仗,在 Hugging Face 的细分赛道热榜里,之前从来没有中国团队做到过。
更离谱的是,这俩模型刚一开源,全球的极客跟疯了一样往上扑,争先恐后给它做适配优化。有硬核开发者直接把 R2T2 的核心逻辑用 C++ 从头重写,彻底甩掉了对 Python 的依赖,连高端显卡都不用,在苹果 M3 芯片上就能跑出 8 倍于实时的速度。紧接着各种离线工具像下饺子一样冒出来,Core ML 适配版、全离线多语言字幕工具、各类语音输入插件,连 Hugging Face 官方都亲自下场,免费搭了 ZeroGPU 在线 Demo,倒贴算力给大家测试。这种待遇,以前只有全球顶流的开源大模型才能享受到。
很多人可能不知道,这俩模型为啥能让全世界开发者集体认怂。说白了,它解决了所有语音模型憋了好几年没搞定的致命 bug:伪流式转写的 “边听边改” 问题。你肯定遇到过这种情况,用语音转写的时候,刚蹦出来的字突然闪一下就变了,平时看字幕忍忍就过去了,要是接了 AI 助手的话,你说 “给张伟转三百块不对是三千块房租”,Whisper 能给你中间改成九千块,等助手反应过来钱都转出去了。定闹钟说六点半改七点,它能在六点半、七点半、七点之间来回横跳,点个外卖宫保鸡丁能来回改好几次都写不对。
而有道的 R2T2,直接把 “落子无悔” 焊死在了模型里,字只要一上屏就纹丝不动,绝无回头修改的可能。它用的这套 “最长稳定前缀” 训练方法,每进来 80 毫秒的音频就做一次判断,听准了就直接提交,没听清就再多等一会,同样的基础模型,没经过这套训练的错误率高达 39.72%,训完直接降到 3.48%,差了整整十倍。哪怕和那些随时可以回头改字的头部商业 API 比,R2T2 的错误率更低,延迟还只有对方的一半。
如果说 R2T2 搞定了 “听” 的问题,另一款登顶翻译榜的 T3PO,就是专门解决 “译” 的痛点,俩名字凑在一起刚好致敬星战的 R2-D2 和 C-3PO,摆明了就是要做语音场景的黄金搭档。它把同传 “快了就错、准了就慢” 的死局直接打破,模型自己判断上下文够不够,够了就立刻译,不够就多等几秒,两个模型串在一起,直接把原来 “说完再识别再翻译” 的串行流程,改成了边说边听边译的全流式管道,丝滑得跟真人同传没区别,哪怕说话人中途改口、满嘴口头禅、报一串数字,都能稳稳接住不出错。
![]()
以前大家夸中国 AI 厉害,总说的是通用大模型参数追平了美国同行,现在有道这次双登顶,代表的是中国 AI 的领先,已经从通用主榜,蔓延到了语音、翻译这些要真刀真枪落地的细分赛道。从 2023 年推出子曰大模型,到今年先后开源多模态引擎、多语言 TTS 引擎,再到这次补齐识别和翻译的最后两块拼图,有道用一年半的时间,直接把 Voice Agent 需要的完整语音闭环全打通了。未来能替人开会、接电话、做同传的 AI,谁能有这双听得准、绝不乱改的耳朵,谁就卡住了下一代 AI 的入口。
现在这两个模型已经在 GitHub 和 Hugging Face 全面开源,感兴趣的朋友可以去试试。说真的,你有没有遇到过语音转写乱改字的糟心经历?觉得咱们中国团队能在细分赛道干翻国际大厂的,别忘了点个赞转发,让更多人看看咱们自己的 AI 有多能打。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.