你有没有在看外文技术演讲或直播时,恨不得把耳机里的声音直接换成自己的母语,而不是一直盯着字幕?大多数人可能觉得这种实时配音还停留在科幻电影或专业演播室里,但实际上,一个轻量的开源 Chrome 扩展已经把它变成了浏览器里随手可用的功能。
这个项目叫 ALAD(全称 Live Audio Dubbing),开发者只用了很短的时间就搭建出一个原型:它能直接捕获你当前 Chrome 标签页里正在播放的音频,实时翻译,再用合成语音把翻译结果“配音”出来——全程在浏览器本地完成,支持 78 种语言。背后驱动这一切的,是谷歌 Gemini 3.5 的 Live Translate 接口和双向 WebSocket 流。
![]()
换句话说,你看 YouTube 上的英语会议、日语教程、韩语直播,不用等字幕、不用切软件,声音可以直接变成中文、法文、西班牙语等几十种目标语言,延迟低到几乎感觉不到。
我们先把这个插件的“一图读懂”式核心结构拆解开。整个流程像一个三明治:顶部是浏览器里的弹出界面(Popup UI),负责管理语言切换、API 密钥和会话状态;中间是后台服务工作者(Background Worker),它抓起活动标签页的原生音频流;底部则是 Gemini 3.5 的实时翻译接口,通过双向 WebSocket 让音频块连续流入、翻译后的音频碎块连续流出。最后,这些配音流被送回你的耳朵,整个过程没有任何用户数据留存到云端,API 密钥也只存本地。
具体来说,一旦你点下“开始配音”,ALAD 会利用 Chrome 的 chrome.tabCapture API,直接抓取当前活动标签页里所有正在播放的音频。这里不需要任何额外插件或虚拟声卡,只要标签页在出声,就能被捕获。捕获到的不是解码后的文件,而是原始的 PCM 音频块(脉冲编码调制格式),这种格式的好处是无需等待完整的句子或段落,拿到一小块就立即送走一小块。
紧接着,这些音频碎块被连续推向一个双向 WebSocket 端点。这个端点专门对应 Gemini 3.5 的 Live Translate 功能,也就是 BidiGenerateContent 接口。所谓“双向”意味着连接一旦建立,客户端可以一边不停地往服务器扔音频数据,一边不停地从服务器接收翻译后生成的语音片段。传统的翻译工具往往需要等到说话人停顿时才能给出结果,而这里音频的输入和输出是同时进行的,延迟被压缩到数百毫秒级别。
Gemini 3.5 在云端接收到这些实时音频后,会识别语种、理解语义,并转化成选定目标语言的文本,紧接着由语音合成引擎直接将文本转成自然语音片段发回。整个过程不需要人工切句,也无需把完整音频存储下来再处理。这种流式处理意味着你几乎在听到原声的瞬间,就能听到翻译过的配音——对于直播场景尤其重要。
除了核心翻译链路,ALAD 还内置了一个分析仪表板(Stats Dashboard)。它将你的每一次使用会话都记录成可视化日志:包括每天哪个时间段用了多久、哪种目标语言被选择的次数最多,甚至用热力图展示出使用频率的活跃时段。这既是一种对用户习惯的示踪,也可以帮助开发者判断翻译模块的压力分布。同时,这些统计数据同样只保存在本地,没有上传。
功能上,它明明白白标出了 78 种语言的支持范围。虽然官方没有逐一列出,但从接口定义来看,覆盖了主流官方语言和相当多的小语种。也就是说,不仅能完成英译中、日译英这些常用组合,对于相对少见的语言对也具备基本的翻译与合成能力。而配音的声音并不是机械的金属音,Gemini 3.5 自带的语音合成引擎会根据语言和语境调整音色与韵律,在实际体验中更接近自然口语。
那么,这个插件的架构到底是怎么串连起来的?从代码仓库就能看得很清楚。ALAD 总共依赖三个核心文件:background.js 扮演调度中枢,它既要调用 chrome.tabCapture 取音频流,又要维护 WebSocket 的连接状态,还要把用户的配置和密钥安全地传下去;gemini.js 则专门封装 Gemini Live Translate 的客户端逻辑,负责打开 WebSocket 连接、发送 PCM 音频块和接收返回的音频片段;前端 popup 页面承载了所有的用户交互,包括语言选择下拉框、API 密钥配置框和开始/停止按钮。
值得一提的是,WebSocket 的握手和通信都是在后台服务工作者的独立线程里完成的,完全不会阻塞浏览器主线程,也不会因为你切换到其他标签页就中断翻译。即便你把弹出窗口关掉,后台的配音仍然继续运行,只有当你主动停止或关闭标签页音频来源时,流程才会终止。
安全性方面,ALAD 也做了明确的隐私声明。一是音频流自始至终都在实时处理,不会被写入磁盘或上传到任何存储服务;二是 API 密钥只保存在你的本地设备上,通过 Chrome 的存储 API 加密存放,其他扩展甚至页面脚本都无法读取。相比那些必须把音频文件发到第三方服务器再等待翻译结果的传统方案,这个架构无疑更尊重用户隐私。
上手成本也低到离谱。只要你有一个谷歌账号并开通了 Gemini API 的访问权限(目前开发者版本可以免费申请),再正常安装 Chrome 浏览器,整个过程不到两分钟就能跑通。当开发者在仓库里挂出的步骤就是:先 git clone 代码,接着在 Chrome 的扩展管理页面打开开发者模式,点击“加载已解压的扩展程序”并选中项目目录,最后在弹出界面里填入你的 API 密钥、选择目标语言,立刻就可以对任意标签页启动实时配音。
当然,因为这是一个完全开源的早期项目,代码还在快速迭代中。但已有的能力已经足够说明:实时跨语言语音转换不再是巨头产品的专属功能,一个开发者和一个浏览器扩展就能用公开 API 搭出可用的原型。下一次你再看外文内容时,或许真的可以关掉字幕,直接听自己语言的声音了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.