你的Agent返回HTTP 200,延迟在预算内,没有任何工具调用报错。但它还是把3A座位标记为"已确认",从头到尾没问过选座子Agent这个座位到底空不空。或者,它给一个资料里写着素食的旅客,推荐了一家佛罗伦萨牛排馆。
每个在生产环境运行Agent的团队,都在试图回答同样三个问题:我的Agent表现如何?它有哪些反复出现的失败模式?我怎么改进——改点东西、确认有用、并且不让它退回去?
![]()
前80%很快,后20%才是坑
把Agent做到"能处理你预想到的测试用例"这个程度,今天相对直接也相对快。一个评估数据集、一个编码Agent、加上"跑-评分-修-对比"的紧凑内循环,通常几天就能在已知场景上拿到任务成功。
然后你上线了,质量曲线就平了,甚至往下走。
剩下20%难在哪?难在上线之后地面会动。用户发现Agent真正能干什么之后,使用方式就变了,线上流量不再像你最初的评估集。
同时底层系统也在变:升级模型、更新harness、改动某个工具或技能,一切照常运行,健康检查全绿,但对话质量和任务成功可能已经悄悄偏移——标准部署流水线根本不会警告你。
而当某次会话真的出了问题,想搞清楚原因,意味着要拆开几层从外面看几乎一模一样的环节。这些失败模式可能归属不同的负责人、对应不同的修法。
原始轨迹记录的是"什么接在什么后面",不是"什么导致了什么"。要区分这些层,得把失败的轨迹和产生它的那个确切代码版本放在一起读。
在线评估看板会告诉你分数动了,编码Agent也能检查trace——前提是你知道往哪看。但在生产量级下,没人能靠手读每一段对话。
AQuA怎么干活
AQuA(Ambient Quality Agent)运行在你的Google Cloud项目里、你的Agent旁边,无人值守。它按计划、每次部署后、或按需从Cloud Trace、Cloud Logging、BigQuery里扫生产轨迹,你合上笔记本它也在跑。
原始会话记录、源码快照和BigQuery表都留在你的项目边界内,AQuA从不进入请求路径,也不回写你的Agent。
每次运行读取一批近期会话样本,走一条五阶段流水线。可以把它理解成一个初级质量工程师做第一遍筛查:读对话、过滤噪音、为值班的人准备好带证据会话的案卷。
要把第二阶段引向你的领域,你写一份大白话的开发者目标(goal.md),它会附加到每一次评审提示词后面;确定性的Python自定义指标(eval_config.yaml)和评审器并行运行,用来追踪通过率趋势。
默认情况下,AQuA使用单次会话评审器session_review,每次会话一次模型调用,对照清单评估对话,既让计划性扫描保持经济,也产出驱动聚类的实际/预期差异。
你也可以选择启用Gemini平台托管的轨迹AutoRaters(task_success、tool_use_quality、trajectory_quality),它们运行专门的逐指标评估器——比如你想用标准化的开箱即用评分卡给会话打分,或者让指标和离线评估对齐。
当某条洞察值得深挖,你从看板Chat或agents-cli aqua run触发根因分析。AQuA会读取失败轨迹,连同部署时捕获的不可变源码快照。
缺陷在你的仓库里时,它引用:-并提出锚定到快照行的修改建议;故障在你的代码之外时(上游依赖、交接、或检索到的载荷),它把失败归因到轨迹中的那一步,不提代码diff。它从不自行应用修改或开pull request。
它卡在你已有的两个循环之间
离线评估用已知测试用例给候选构建打分,在线评估监控生产中的通过率趋势,编码Agent或专门的优化器去改提示词和代码。
AQuA的位置在它们之间:把原始生产流量变成经过诊断、锚定代码的洞察,以及归档的失败记录,用来喂养你的内循环。
拿travel-concierge(google/adk-recipes)跑一遍看看。它把旅客路由给多个子Agent——inspiration_agent、place_agent、poi_agent、planning_agent、flight_search_agent、flight_seat_selection_agent、booking_agent,以及pre_trip / in_trip / post_trip,并通过memorize(key, value)(travel_concierge/tools/memory.py)把工作行程存进session state。
把AQuA接到travel-concierge项目上需要三条agents-cli命令:
agents-cli extension add "${AQUA_CHECKOUT}"
agents-cli infra single-project --project="${GOOGLE_CLOUD_PROJECT}" --apply
agents-cli deploy --project="${GOOGLE_CLOUD_PROJECT}" --region us-east1
除了AQuA的runner、BigQuery数据集和Cloud Run看板(在Identity-Aware Proxy后面),agents-cli deploy还会把travel-concierge源码树的不可变快照写入Cloud Storage,以部署修订版本为键(Revision 1)。
在看板的Configuration页面上,我们保存一份开发者目标(goal.md),把评审引向高层产品不变量、抑制风格噪音(同时仍然要求每条发现都引用一个具体的轮次,即某个Agent或子Agent违反其指令或工具标准的地方)。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.