当团队把内部AI流量接入网关几周后,账单开始上涨,部分请求的响应速度也比预期慢。这是组织规模化采用AI时常见的困扰,但仅凭模型名称和请求次数,很难判断问题出在哪里。
开发者可能在用AI处理越来越复杂的编码任务,智能体可能为完成一个任务发起了过多后续调用,也可能只是少数用户或智能体贡献了不成比例的用量。令牌数和请求数本身无法区分这些模式。
![]()
模型过配视图:找出"大材小用"的对话
新上线的模型过配视图,用于识别所选模型能力明显超出任务需求的对话。比如团队可能发现,用户或智能体把简单的格式整理、摘要请求发给了高能力推理模型。
这给组织提供了一个调查起点:可以看到哪些用户、智能体或应用与这一模式相关,再进一步排查背后的任务。团队可能发现,某个模型被使用只是因为它是默认选项,或者用户不确定该选哪个模型,又或者智能体被配置成每一步都用同一个模型。
该视图不是排行榜,也不会自动推荐替换模型。它帮助团队提出更好的问题:
- 这个模型适合当前任务吗?
- 多出来的能力是否改善了结果?
- 换成更快或更便宜的模型,能否得到同等效果?
- 问题是否只局限于某个工作流、某个用户或某个智能体?
在此基础上,团队可以对比成本、延迟、令牌用量和对话轮次,再决定要改变什么。
任务分析与轮次分析:看清工作全貌
任务分析按工作类型对对话进行分组,初始类别包括编码、研究、写作、摘要和数据分析。这提供了模型名称列表无法给出的上下文。一个工程团队可能主要用AI做编码和调试,另一个团队则用于研究和摘要。团队也可能发现,相当一部分流量来自简单任务,而这些任务却被发给了高能力模型。
轮次分析则展示不同任务需要多少来回交互。有些任务一次交流就完成,有些则需要多轮提问、纠正和跟进。长对话未必是坏事,尤其是复杂工作。但如果一个简单任务持续占用多轮,就值得检查提示词、模型或工作流。
首次请求只是成本的一部分。团队还应关注任务完成前花费的时间、令牌和费用,对比这些数字能发现哪个工作流耗时或花费超出预期。
从洞察到自动路由
当团队确认了过配模式,并在任务、成本、延迟和轮次数据上得到验证后,就可以把这一洞察转化为自动路由决策。例如,任务视图可能显示团队大部分AI用量是摘要和格式整理,而模型视图可能显示这些请求被发送到了某个高能力模型。
这些能力与新的潜在节省视图和自动路由器相互配合。潜在节省视图帮助团队识别那些可能由更快或更便宜模型处理、且不损害输出质量的请求;自动路由器则自动应用任务与模型匹配信号,无需为每个工作负载单独配置路由规则,从而帮助降低成本。
过配视图是评估模型匹配度的起点。团队可以对比同类任务的延迟、输入输出令牌、对话轮次和总成本。困难的编码或研究任务可能需要高能力推理模型,而简短摘要或简单分类任务则未必。目标不是把每个请求都转移到最便宜的模型,而是理解所选模型是否适合当前工作。
该功能对AI Gateway用户免费开放。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.