所有人都在给你演示AI Agent的智能,但几乎没人给你看它的账单。为了搞清楚Agent真正干活时到底要花多少钱,我把一个在n8n上搭建的客服Agent连跑100次——用同一个包含12张工单的收件箱,反复跑、不停跑。
这不算测试数据,而是1200次真实的模型调用。当计量表停下时,我看到了两个连价格页面都不会告诉你的结论。
实验是怎么设计的?这个Agent在自托管的n8n里由三个代码节点构成:第一步,加载工单和一个小型知识库;第二步,由模型作答或升级处理——模型只能依据知识库回答,而且必须标明引用了哪一条,没有引用就不算有效回答,工单会被转给人工。正是这条规则,堵死了模型胡编乱造的通道;第三步,由确定性代码做最后把关,判断模型的回答是否合格,并把结果分别写入answered.json、escalated.json和summary.json。
为了计算成本,我把整个收件箱放进循环里跑了100次。所有模型调用走的是meta-llama/llama-4-scout,通过fal平台计费,按请求数收取固定费率。每次响应都会带着一个x-fal-billable-units计费头,你可以自己核验。
账单是多少?1200次调用(100次循环×12张工单),fal公开费率为每次请求0.001美元,总计1.20美元。折算下来,每张工单的模型成本是一美分的十分之一。再放大看:每月处理1000张工单,模型调用成本大约1美元,外加一台约4美元的小服务器跑n8n——加起来一个月5美元。
对比一下市场标杆Intercom Fin:公开报价是每次解决问题0.99美元。Fin是一个完整平台,包含收件箱、路由、分析、合规,而这次测试的Agent完全没有这些。但剥离这些包装,那0.99美元里真正属于模型推理的部分,只有0.001美元。剩下的98.9美分,买的是平台、编排和生态的打包服务。有些场景确实值,但至少你现在知道钱花在哪了。
不过便宜不等于可靠,如果每次决策都不一样,再便宜也没用。所以我用同一组12张工单跑了全部100次,问了一个不同的问题:这个Agent每次都会做出相同的决策吗?结果是,100次运行中有98次保持一致。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.