当你在本地把Agent调得完美无缺,一上线却频频翻车——这往往不是模型的问题,而是评估方式本身就不一致。7月31日,Google Cloud宣布其Agent Platform中的Agent与模型评估功能正式全面可用(GA),为开发者提供了一套贯穿开发与生产、基于统一个度量引擎的质量衡量体系。
这套评估引擎的核心思路是:在开发阶段,用你编写的用例来测量Agent质量;上线之后,则用Agent实际执行的任务来持续打分。两阶段使用一致的指标与评判标准,如果生产环境中出现质量漂移,它直接指向Agent本身的问题,而不是度量方式的变化。
![]()
平台内置了超过20种预构建指标,覆盖质量、安全性、接地性、工具使用与轨迹,以及面向摘要、翻译等任务的基于参考的评分。更值得关注的是其自适应的评分细则:它能为每个用例定制评判标准,而不是用一个生硬的“LLM当评委”提示去机械套用不同场景的问题。用户还可以自定义基于代码或基于LLM当评委的指标,并保存在版本化、跨组织共享的指标库中,确保评分的一致性与可对比性。
![]()
在实验层面,开发者可以选择在本地或服务端运行。服务端模式下,所有实验工件都会存储在Cloud Storage中,让每一次运行都可审计、可重现。实验功能还集成了用例生成工具,能自动引导出评估数据集;用户模拟器则能模拟多轮对话的测试用例,无需为每一轮回复手写脚本;环境模拟器可以替代Agent实际调用的后端系统,让你安全地模拟失败或慢速后端,完全不影响生产环境。
线上监控同样被整合进来。通过对生产环境中的实时流量进行持续评估,平台可以直接对你已收集的追踪数据进行评分,自动生成分数随时间变化的图表,并在出现质量漂移时发出警报,不必额外搭建自定义的数据处理管道。
![]()
开发者可以通过Agent Platform SDK、agents-cli命令行工具、Google Cloud控制台中的评估专区,以及ADK等多个入口来触达这些评估能力。评估的基本工作单元是“实验”,由一个评估用例数据集与一组指标构成,随着迭代可以反复运行、查看评分结果。平台提供了一个灵活的界面,从定义指标、发起新的运行,到逐条复盘失败样例——你可以直接点开一个失败的评估结果,打开Agent的完整追踪记录与对话日志,精准定位问题发生在哪一步。
针对大规模评估作业,系统还提供了问题聚类能力:它能按失败原因将评估失败项自动分组,形成可解读、可操作的集群。你可以自定义失败原因分类法,也可以直接使用平台预置的、为自适应评分细则设计的现成分类体系,让复盘不再淹没在散乱的错误报告中。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.