错误率降低约一半,价格一分没涨。当地时间9月18日,SpaceXAI发布Grok Voice Transcribe 2.0语音转文本模型,官方给出的核心卖点就这一条:同样的价钱,错得更少。
在Artificial Analysis榜单中,这款模型在全部32款流式模型里准确率高居榜首。榜单之外,SpaceXAI还拿线上实际业务采样的四个内部数据集做了系统评测,覆盖客服电话音频、与Grok的日常英语对话、电话号码邮箱地址等口述信息,以及多语种简短语音指令。四个测试集上,2.0版本全面超越1.0。
![]()
底子来自哪里
Grok Voice Transcribe 2.0基于Grok Voice底层的音频基础模型构建。这套底层能力已经在跑真实业务:每天承接数万通客服电话,转录数百万小时的视频旁白,还驱动实体硬件里的各类语音智能体,其中就包括特斯拉车辆中搭载的Grok助手。
换句话说,2.0不是实验室里憋出来的新模型,是在已经跑量的业务上迭代出来的版本。客服电话、口述信息、多语种指令这几类测试集,本身就是它日常要处理的活儿。
价格没动,功能全包
定价与1.0版本保持完全一致:
- 批量转录:每小时音频0.10美元,约合0.67元人民币
- 实时流式转录:每小时0.20美元,约合1.3元人民币
说话人分离、精确时间戳、自定义关键词三项功能全部包含在内,不需要额外付费。对做会议记录、客服质检、视频字幕的团队来说,这几项通常是单独计费或者干脆不提供的。
错误率砍半叠加价格不变,等于单位成本下的可用转录量翻了一倍左右。语音转文本这条赛道上,准确率和价格长期是一对矛盾,这次SpaceXAI选择在价格原地不动的前提下动准确率,把压力留给了同榜单的其他31款流式模型。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.