谷歌把旗下Gemini模型的战场从文字和代码推进到了实时语音。当地时间9月15日,谷歌宣布推出Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking两款实时音频模型,并称这是其目前最先进的实时对话模型。两款模型不仅可以进行更加自然、流畅的语音交流,还能在对话不中断的情况下调用工具、处理视觉信息和执行复杂任务。
这意味着,谷歌正在尝试让实时语音AI从此前的“语音版聊天机器人”,进一步变成能够听懂、思考、调用工具并把事情做完的语音智能体(Agent)。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.