谷歌一次性端出两个新模型:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。名字长,但指向很明确——实时语音交互。
两个版本,两种思路
![]()
标准版主打实时响应,Extended Thinking 版则把推理能力拉进来。官方说法是,两者都在三个维度上做了增强:推理、视觉锚定、多步任务完成。
- 推理:不只是听懂,还要想清楚
- 视觉锚定:语音之外,看得见上下文
- 多步任务:一句话交代,分几步办完
开发者先受益,消费者跟着用
这两个模型同时面向开发者和普通用户。对开发者来说,多了一个能接进实时语音场景的选项;对消费者来说,语音助手的反应和办事能力会往上走一个台阶。
实时语音这条赛道,过去拼的是延迟和自然度。现在谷歌把推理和多步任务塞进来,等于把竞争维度换了——语音不再只是问答,而是能连续办事。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.