AI工具已经嵌入Uber软件开发的每个阶段。超过70%的代码合并请求由本地或云端智能体生成,工程师们在软件开发生命周期中构建了超过3600个智能体技能,每天执行超过30000次智能体技能调用。这个规模下,成本控制成了真正的技术活。
请求量涨了9.4倍,总支出却稳住了
![]()
在2026年AI工程师大会上,Uber分享了软件工厂的愿景,以及在各阶段构建的模块和托管智能体。越来越多的工作会话不再由人工发起,而是由自动化托管智能体完成,包括代码评审、CI故障自动修复、完成端到端PR(含视觉验证)、分级处理值班告警、调试新提交的错误,以及各类代码维护任务。
从2026年2月到8月,所有员工在所有智能体产品中的周活跃用户增长了7倍,周智能体请求量增长了9.4倍。与此同时,AI总支出自4月份以来已相对稳定。这个反差背后是一整套成本优化体系。
固定模型做对照,单次会话成本降了52%
工具采用率、工作负载构成和模型版本升级都在持续变化,想单独衡量自身优化带来的收益,就需要固定使用同一个模型。Uber从2月到7月做了对照测试:每1000次模型请求的成本较峰值下降了近34%,每次会话的成本较6月峰值下降了52%。
对比的所有定价与供应商指标均基于公开信息,成本效率提升源于在标准定价层级内对内部业务负载进行更智能的路由调度。实际效果会因代码库、团队规模、智能体工作流的不同而存在差异,但基于真实业务进行基准测试、围绕准确率与成本进行优化的方法论具备普适性。
四个层级,越往上掌控力越强
Uber将AI使用划分为四个层级,从高度专用到通用能力依次排布。层级越高,对成本、质量以及模型选择的掌控力就越强。智能体会话的成本可以分解为六个相乘的项,前两项代表采用率和参与度,中间三项提供优化机会,即智能体在工程师实际请求之外自主完成的额外工作。
这是Uber投入最多精力的地方,包括帮智能体更快规划、减少不必要的轮次或错误、优化输入token等机制。他们按周、按月跟踪完整指标集,依靠这些指标对短期与长期工作进行预测和规划。
模型选型:帕累托最优的三个标准
在所有托管智能体层级中,Uber为每种工作负载选择帕累托最优的模型。帕累托最优意味着三件事:每次完成任务的成本、输出质量和模型可靠性。模型选型分为四个步骤:基于智能体的真实业务任务构建基准测试;在支持任意模型的Harness上运行智能体;迁移到帕累托最优的配置并持续迭代更新;借助托管智能体生成的聚合洞察持续优化工作负载性能。
以uReview为例,Uber用它处理所有PR的AI代码评审。他们基于包含已知错误(分为简单、中等、困难三级)的真实PR构建基准测试,针对这些错误计算精确率、召回率和F1分数,同时统计每次评审的成本、延迟、超时和噪音。切换模型提高了F1分数,同时大幅降低了每个PR的成本。
基于大型单体代码库中数千个真实PR,Uber内部构建了一个Uber SWE基准测试,针对不同任务类型运行前沿模型与开源权重模型,用它来为所有SDLC托管智能体的模型选择提供依据。
子智能体默认设置:最具影响力的手段
在交互式界面中,token单位成本保持不变,但可以根据策略在不同模型之间分配token。主要由两项默认配置控制token分配:初始会话模型和子智能体模型。子智能体默认设置被证明是最具影响力的手段,且重要性还在持续提升。
随着新一代模型能力实现更有效的多智能体编排,发起子智能体的会话比例稳步上升。子智能体执行的是输入明确、任务边界清晰的任务,通常不需要前沿级别的模型推理能力,因此被默认设置为能力稍弱但性价比更高的模型,同时也支持人工覆盖修改配置。主模型负责任务分解和评估,子智能体执行具体的任务。
压缩与推理强度:直接砍掉高成本token
每一轮对话都会重新发送完整的对话历史、项目上下文和工具结果。任何能够减少每次请求负载的措施都会在整轮会话中产生复利效应。所有交互式Harness都使用统一的封装层,负责安装管理、配置、鉴权以及成本可视化。两套标准化默认配置可以直接降低单次请求的token消耗量。
自动压缩在达到40万token时触发,即使是支持100万上下文窗口的模型也是如此。这个阈值在模型性能与缓存突增和重复输入token成本之间取得了平衡,显著降低了长会话的累计开销。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.