170毫秒。这是VoxWeft在M5 MacBook上输出第一段译音的时间。开发者@HenryZ30734018把一套开源同声传译系统做成了完全本地运行的东西,音频不出设备。
它基于VoxCPM2,用的是MLX实现。现场语音进去,翻译后的语音出来,全程在Apple Silicon上完成。没有云端往返,没有上传等待,音频隐私和响应速度被同时保住。
![]()
四个硬指标,逐条看
第一,延迟。VoxCPM2在M5 MacBook上流式输出首段音频约170毫秒。这个数字决定了同传能不能跟上说话人的节奏,而不是等一句话说完再翻译。
第二,语种。系统可生成30种语言的语音,支持直接的语言对互译,不需要经过中间语言中转。中转会带来二次误差和额外延迟,直接配对绕开了这一层。
第三,音色。从约5秒的参考音频里克隆目标声音,让整段翻译保持同一个音色。同传场景里,声音忽男忽女忽机械,听感会直接崩掉,音色一致性是体验底线。
第四,算力。跑在MLX上的4-bit量化版本,让低延迟的本地语音生成在Apple Silicon上变得实际可用。量化是本地跑得动的关键前提,否则模型体积和推理开销会把延迟拉回去。
它想证明的不只是能出声
VoxWeft展示的是VoxCPM2作为完整实时应用语音层的可能性。它不只是产出音频,而是让私密的多语言交互留在设备上完成。
这个定位值得琢磨。同声传译过去是云服务的典型场景:算力重、模型大、延迟敏感,本地跑几乎是奢望。现在一套开源系统把它压到了笔记本芯片上,且不牺牲语种数量和音色质量。
对开发者来说,可复用的部分很清晰:MLX实现、4-bit量化、流式首包延迟控制、参考音频克隆。这些模块拆出来,能拼进会议记录、直播字幕、跨境客服、无障碍沟通等任何需要实时语音转换的场景。
项目已在GitHub开源,VoxCPM2模型发布在Hugging Face的openbmb仓库下。想验证170毫秒和30种语言这两个数字的人,可以直接拉下来在自己的Mac上跑一遍。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.