把实时语音智能体从"演示能跑"推进到"上线可信",Google 的 ADK(Agent Development Kit,智能体开发套件)刚刚补上了关键一环——原生实时评估能力。现在,开发者可以用模拟用户驱动语音智能体,对每一轮语音回复自动打分,整个过程跑在原有的文本智能体评估流程里,无需切换工具链。
这套评估逻辑解决的是真实场景里的老大难问题:语音对话中,时机和恢复能力跟内容本身一样重要。昨天听起来完美的行为,可能在下一次提示词调整或模型迭代后悄悄走样——工具不触发了、上下文在轮次间丢失了、插话被忽略了。靠人工听几段录音很难发现这类回归,可重复的自动化证据才是上线信心的来源。
![]()
一个完整的实时评估闭环
![]()
官方给出的示例是一个图结构工作流:三个单一职责的实时智能体顺序串联,每个阶段都跑在 gemini-live-2.5-flash-native-audio 模型上。整个流程覆盖了从创建智能体、编写评估用例、运行评估到检查录制结果的完整链路。
三个智能体的分工很清晰:
- greeter_agent:扮演客服助理 Sam,先确认来电者是 John Doe,每轮只问一个问题,用确认到的名字完成任务
- dob_verifier_agent:询问出生日期并复述确认,然后调用 validate_date_of_birth 工具校验(示例中固定匹配 1985-07-12),输出 verified 或 unverified
- goals_agent:身份验证通过后,主动告知 6 月 16 日周二下午 3 点与 Dr. Example 的预约,回答问题后以 "Goodbye" 收尾
模拟用户说语音,回复按轮次打分
![]()
评估的核心机制是:模拟用户以音频形式说出每一轮对话,系统对智能体的语音回复进行评分,所有数据都沉淀在同一个评估循环里。这意味着开发者可以在每次模型更新或提示词调整后,快速跑一遍完整评估,用可量化的分数确认行为没有回退。
对于正在把语音智能体推向生产的团队来说,这套能力把"感觉还行"变成了"有据可查"。评估结果不再是零散的录音片段,而是结构化的、可对比的、能追踪到具体轮次的证据链。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.