把实时语音智能体从“演示能跑”推进到“上线可信”,缺的不只是流畅的对话效果,而是一套可重复的评测证据。Google 的 ADK(Agent Development Kit)现在把这项能力直接做进了开发工具里。
ADK 新增了原生实时评测(live evaluation)能力。开发者可以用一个模拟用户驱动语音智能体,模拟用户以音频形式说出每一轮对话,系统对智能体的语音回复进行打分——整个过程跑在开发者原本用于文本智能体的同一个评测循环里,无需另起一套流程。
![]()
三个单任务智能体串联成一个工作流
![]()
官方示例展示了一个完整的实时评测闭环:创建智能体、编写评测用例、运行评测、检查录制结果。示例采用基于图(graph)的工作流,三个单任务实时智能体按顺序串联,每个阶段都运行在 gemini-live-2.5-flash-native-audio 模型上。
三个智能体分工明确:
- greeter_agent:扮演客服助理 Sam,先问候来电者并确认对方身份是 John Doe,每轮只问一个问题,确认姓名后完成任务。
- dob_verifier_agent:询问来电者出生日期,复述确认后调用 validate_date_of_birth 工具(模拟校验,匹配 1985-07-12 即通过),以“verified”或“unverified”结束任务。
- goals_agent:身份验证通过后,主动告知 6 月 16 日(周二)下午 3 点与 Dr. Example 的预约,回答提问后礼貌结束通话。
为什么实时评测是上线前的一道硬门槛
![]()
把实时智能体投入生产,比做好一个演示复杂得多。它必须在多轮口语对话中持续做出正确动作——时机和恢复能力与内容本身同等重要。昨天听起来完美的行为,可能在下次提示词调整或模型迭代后悄然改变:工具停止触发、上下文在轮次之间丢失、插话被忽略。
带着信心上线,需要可重复的证据,证明智能体在真实用户会进行的对话中表现稳定。ADK 这次把实时评测纳入原生工具链,正是为了补上这块拼图——让语音智能体的行为像文本智能体一样,可以被测量、被信任。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.