作者|周雅
大家日常用语音跟AI聊天的过程中,有没有遇到这种情况:要么它接话挺快,要么稍微来点复杂的任务它就犯傻,场面一度尴尬。
这是实时对话模型眼下面临的一个技术矛盾:“深度思考”与“流畅对话”之间的平衡,模型越需要“深度思考”,对话往往就越不“实时”,导致人和AI之间的对话走向一种奇怪的不同频节奏。
美国当地时间9月15日,Google正式发布两款实时对话模型Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking,似乎就在试图解决这个矛盾,因为这次升级真正瞄准的,正是能够一边对话、一边推理和调用工具的语音Agent。
具体来看两款模型:
Gemini 3.8 Live走的是更轻量、低延迟、低成本的路线,重点面向实时对话场景。除了语音输入输出,它还能结合图片、视频进行近实时视觉理解,并支持工具调用和Google Search Grounding,更适合客服、日常助手、车载交互等对响应速度、并发规模和成本都比较敏感的场景。
Gemini 3.8 Live Extended Thinking是“深度思考”版本,专注于复杂推理和多步骤任务。它可以在后台持续思考、调用外部工具或API、等待任务结果,同时在前台继续和用户唠嗑。它更适合行程规划、复杂客服、销售助手等需要边交流、边推理、边执行任务的语音Agent场景。
![]()
01. 对话质量如何?
Speech to Speech Index由第三方评测机构Artificial Analysis维护,综合评估语音Agent在语音推理(Speech Reasoning)、智能体任务表现(Agentic Performance)、Arena 用户偏好(Arena Preference)、任务成功率(Task Success Rate)四项维度的表现,是目前语音Agent领域最常被引用的整体指数。
在此方面,Gemini 3.8 Live Extended Thinking (High) 以82.6分登顶,领先GPT-Live-1(Astra, Medium)的81.5分,领先Grok Voice Think Fast 2.0 High的81.3 分。Gemini 3.8 Live以76.0分位居第五名。
![]()
图:Artificial Analysis Speech to Speech Quality Index位次对比(来源:Artificial Analysis)
需要注意的是,位居榜单中段的 Gemini 3.1 Flash Live High(71.5 分)和更靠后的 Gemini 3.1 Flash Live Minimal(63.9 分),都是Google上一代的语音模型。3.1 系列在综合指数上落后3.8系列10分以上,说明这一代升级是实打实的能力跃迁,而非小幅微调。
从数据分布看,前三名之间的差距非常窄,都在1.5分以内,说明当前主流语音Agent在通用对话质量维度上的能力已经相当接近,真正的分野可能出现在具体任务和成本维度上,这也是接下来两个基准要拆解的内容。
02. 完成Agentic任务如何?
τ-Voice是一个专门评估语音Agent的基准测试,主要看一个语音Agent在真实对话里,能不能听懂、遵守规则、调用工具,并把事情真正办完。
Gemini 3.8 Live Extended Thinking (High) 在τ-Voice方面得到68.6%的通过率,位居第一,险胜于GPT-Live-1 (Astra, medium) 的67.9%,OpenAI的GPT-Live-1 (Sol, low) 以59.3%位居第三。
![]()
τ-Voice 的三个测试子域,也就是航空、零售、电信,各自有明显不同的任务特征。航空场景涉及多轮改签和退款;零售场景涉及订单争议和退货流程;电信场景涉及套餐变更和账单处理。
分行业看,Gemini 3.8 Live Extended Thinking 在电信场景以84%的通过率位居第一,明显领先GPT-Live-1 Astra的80%;在航空场景以72%位居第一,与Astra打平;但在零售场景以50%落后Astra的52%。
这一分行业差异对企业采购语音Agent有参照意义:电信、金融、银行等强合规、长链路场景,Gemini 3.8 Live Extended Thinking是当前τ-Voice 榜单上最合适的选择;但如果场景是电商客服或退换货处理,选择的天平会略微倒向OpenAI的Astra。
![]()
真正值得注意的是Sierra的τ³-Banking基准,这是一项专门评估语音Agent在银行业务场景下端到端完成能力的基准,涉及账户查询、转账验证、争议处理、身份认证等多步流程,对合规约束、错误处理、多步授权的要求都高于通用场景。
Gemini 3.8 Live Extended Thinking (High) 以35.1%的通过率位居第一,第二名GPT-Live-1 Astra (Medium)是32.0%,第三名xAI-Realtime只有16.5%,第四名Gemini 3.1 Flash Live (High) 是11.3%,第五名GPT-Realtime 2 (High) 是10.3%。
![]()
这里值得注意的变化,是Gemini 3.8 Live Extended Thinking,在τ-Voice上仅比Astra高出0.7个百分点(68.6%对67.9%);到了银行业务测试,这一差距扩大到3.1个百分点(35.1%对32.0%)。τ³-Banking要求Agent从大规模、相互关联的银行政策文档中找到正确规则,并连续完成账户查询、争议处理、产品变更等多步工具调用。因此,这组结果至少表明:在更强调知识检索、规则理解、多步骤执行的复杂任务中,Gemini 3.8 Live Extended Thinking相对GPT-Live-1 Astra的领先幅度有所扩大。
不过,35.1%的绝对通过率也揭示了另一面:即使在这组测试中表现最好的模型,在复杂银行业务流程里,仍有相当长的路要走。真正进入生产环境,还需要更严格的权限控制、流程约束、人工兜底和持续评估。
03. 语音推理如何?
Big Bench Audio是评估模型音频推理能力的基准,覆盖对语音材料的理解、逻辑判断和内容推断。Gemini 3.8 Live Extended Thinking在这项基准上拿到97.7%的分数。
但站在这项榜单前三位的,都是中国团队的语音模型:StepFun的StepAudio 3 Realtime以99.7%位居第一,阿里云的Qwen Audio 3.0 Realtime Plus以 99.2% 位居第二,Qwen3.5 Omni Plus Realtime以98.7%位居第三。Gemini 3.8 Live Extended Thinking (High) 以97.7%位居第四,Step-Audio R1.1 (Realtime) 以 97.6% 位居第五。
这是本次评测中最值得国内读者注意的一项结果。语音推理反映的是模型对语音材料本身的理解和逻辑处理能力,是语音Agent最核心的底层能力之一。这说明在语音推理这项底层能力上,中国团队已经站到了全球第一梯队。
![]()
04. 成本如何?
如果说前几项基准Gemini 3.8 Live系列是“窄幅领先”,那么在成本维度上,Google打出的是明显的价格优势牌。
Artificial Analysis以“每小时输入音频成本”作为衡量单位,对比了几款前沿语音Agent模型。Gemini 3.8 Live 以0.84 美元/小时的成本,在所有前沿语音Agent模型中位居最低。Gemini 系列(含 2.5 Flash Native Audio Dialog、3.1 Flash Live 两个版本)连续包揽前四位,都在1.75 美元/小时以下。
3.8 Live Extended Thinking (High) 的成本为3.50美元/小时,处于中档位置,仍然低于同档次的GPT-Realtime-2 (High) 4.14 美元/小时,明显低于 GPT-Live-1 (Astra, medium) 的5.83美元/小时和Grok Voice Think Fast 2.0 High的4.80 美元/小时。榜单最贵的是GPT-Realtime-2.1 High,为10.75美元/小时,是3.8 Live Extended Thinking的三倍多。
![]()
图:每小时输入音频成本对比(Big Bench Audio子集,数据来源:Artificial Analysis)
这次Live系列则直接把成本对比图放出来,显示Google在争取企业用量的意图非常明确。
如果把τ-Voice通过率作为纵轴、每小时成本作为横轴放到同一张图上,Gemini 3.8 Live Extended Thinking位于AA榜单的“最具吸引力象限”(Most attractive quadrant),也就是高任务通过率+相对较低的成本。同象限内还有GPT-Live-1 Astra(成本高66%,但任务通过率低0.7个百分点)、GPT-Live-1 Sol(成本低27%,但任务通过率低9个百分点)、Grok Voice Think Fast 2.0 High、Qwen Audio 3.0 Realtime Plus 等几款模型。
![]()
图:τ-Voice 通过率 vs 每小时输入音频成本,绿色区域为"最具吸引力象限"
05. 从人工偏好到帕累托前沿
除了三项SOTA,Google还提到了一项间接的支撑证据。
在ServiceNow的EVA-Bench测试中,Google表示,3.8 Live两款模型进一步推进了复杂工作流中“任务准确率”和“对话质量”之间的帕累托前沿(Pareto Frontier)。
所谓帕累托前沿,可以理解为两个相互牵制的指标之间所能达到的最佳组合:语音Agent既要把任务做对,又要让对话保持自然流畅,而提升其中一项,往往会以牺牲另一项为代价。Google想表达的是,Gemini 3.8 Live系列的这两项能力同时达到比此前更高的水平。
![]()
Google还特别提到,这项测试基于Gemini Enterprise Agent Platform中的Live API完成,因此相比单纯的模型能力测试,它更接近企业Agent实际使用的技术环境。(不过,这仍然属于标准化基准测试,不能直接等同于真实客户生产环境中的实际表现。)
06. 响应时间如何?
3.8 Live Extended Thinking版本的推理增强在多项能力上都有明显加成,但在响应速度上是有代价的。AA榜单上的Time to First Audio(首字响应时间)指标显示,Extended Thinking的首字响应时间是1.35秒,Grok Voice Think Fast 2.0 High是0.70秒,Gemini 3.8 Live是1.18秒,Google 2.5 Flash Native Audio Dialog是0.63 秒。
![]()
差异也体现在了用户偏好上。Speech Agent Arena是一项以人工双盲偏好投票排名的语音Agent评测,与Big Bench Audio基准不同,反映的是听感与自然度的综合印象。
Speech Agent Arena的Preference Elo榜单上,Gemini的模型包揽前三名。3.8 Live以1083分位居第二,3.8 Live Extended Thinking以990分位居第三。第一名是Gemini 3.1 Flash Live Minimal的1096分。
![]()
07. 底层能力
在具体能力层面,Gemini 3.8 Live 系列的产品设计有几项值得单独说明。
第一项是3.8 Live Extended Thinking的“边想边说”(reason and speak simultaneously)。过去,语音AI在处理需要多步推理的复杂问题时,典型模式是“用户说完,模型思考,模型输出”,中间的思考期是一段静默甚至断裂。3.8 Live Extended Thinking改变了这一顺序:模型会先用一句“Let me check that...”这类早期口头提示接住对话,同时在后台展开多步推理,并通过实时进度叙述(live progress narration)让用户知道多步任务当前进展到哪一步。这一形态改变是本次发布最实质的产品升级,直接对应了语音Agent走进企业客服等真实场景的一个长期障碍:沉默的思考期让用户觉得系统卡顿甚至掉线。
第二项是97种语言的自动切换。Gemini 3.8 Live可以在对话中途识别用户切换到不同语言并跟进。这一点在跨境企业客服和多语言市场的语音应用中意义直接。
第三项是异步函数调用(asynchronous function calling),即模型可以在保持对话不中断的同时,在后台执行工具与API调用,用户不必等待工具调用返回结果。这项能力对语音Agent承担多步业务流程至关重要。
在部署侧,Gemini Live API是核心通道,Google通过Live API把两款模型开放给Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents等多家开发者平台。这些平台已经在语音Agent的实时媒体流基础设施上有各自积累,接入Gemini Live API后,开发者可以直接把注意力放在应用层。
在企业客户侧,Salesforce、Genspark、Lumeris、11Sight、Equal AI、ServiceNow、Lenskart、Ambr AI、Casuu等公司已经在测试或部署这两款模型。在自家产品线上,3.8 Live Extended Thinking已经进入Google Workspace(Docs Live、Gmail Live、Keep Live,面向Google AI Pro和 Ultra 订户),3.8 Live版本接入Search Live提供步骤级问题排障。企业客户可以通过Gemini Enterprise的私有预览接入两款模型。
安全层面,Google 表示所有音频输出都通过 SynthID 加入不可感知的水印,用于AI生成内容的可检测性。
值得注意的是,三家前沿的语音模型能力正在快速趋同,接下来的竞争重心可能会从“模型能力”迁移到“场景应用”以及“实际成本”上,但也不影响它标出了一个可以让企业采购方和开发者作参照的坐标。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.