Token消耗是当下AI 行业的最核心议题,甚至关系到对 AI产业的价值评估。
Glean主营企业AI token成本、RAG上下文架构的优化,年营收3亿美元。公司创始人&CEO Arvind Jain首创token产出率(token yield)行业分析框架,是企业落地大模型成本管控领域的代表人物。
![]()
以下是他今天最新推出的专文:
《你的token开销本质是AI架构问题,而非单纯模型问题》
企业级AI的token开销正在快速攀升,尤其随着技术从简易对话助手转向代码智能体、AI协作助手与长周期运行工作流。
这类系统单次任务的运算量大幅提升,对应的token消耗量也水涨船高。这给企业带来全新运营约束:问题不再是AI有没有实用价值,而是其产出的有效收益能否覆盖投入成本。
各项开销数据已不容忽视。德勤2025年科技价值调研显示,超半数受访企业将21%至50%的数字化项目预算投向AI,平均占比36%。
Ramp近期披露,月度AI开销同比暴涨4倍;《财富》报道称,Uber仅用四个月就耗尽了2026全年AI代码工具预算。
在我和众多企业负责人的交流中普遍发现:token消耗增速持续走高,但业务价值没能同步增长。
正因如此,企业需要跳出原始token用量指标,选用更科学的核算标准。关键不在于系统耗用了多少token,而是每消耗单位token能产出多少有效落地成果,简言之:token产出率。
从AI投入产出逻辑来看,该衡量方式更合理,因为token消耗很少只由模型本身决定,而是受整套配套系统影响:上下文检索逻辑、工具调用方式、任务拆分规则、模型调度策略、过往执行结果复用机制。
一旦架构设计低效,即便最终输出质量没有提升,token开销依旧会持续上涨。
token不单单是提示词里的文本内容
一句简短的用户指令,就可能催生高额token账单。
举例提示词:“分析这些账户流失风险并生成跟进任务”。肉眼可见的提示词篇幅很短,但实际token负载往往包含系统预置指令、工具参数定义、检索获取的文档、中间推理内容、运行日志与记忆数据。
多数企业级AI系统里,绝大部分token并非由用户手动输入,而是任务配套框架自动生成。
这时架构设计的重要性便凸显出来:若系统无差别拉取过量上下文、频繁调用冗余工具、重复执行已完成运算、把常规任务交由成本高昂的前沿大模型处理,token成本上升的同时,产出质量却毫无改善。
资源浪费不在单条提示词,而在顶层系统架构设计。
所以token产出率归根结底是架构层面的问题。
四项决定token使用效率的架构优化方向
1. 上下文质量
多数企业AI落地失利,根源都出在上下文环节。
模型无法自主甄别有效上下文信息,只会全盘处理传入数据;上下文体量越大,模型解析信息产生的开销越高。若检索数据源杂乱冗余,模型会耗费token在无关、矛盾信息上梳理,无法聚焦有效信息落地任务。
优化思路不是往提示词里堆砌更多数据,而是优化检索精度。
这也是上下文层架构至关重要的原因。在对标Claude Cowork类任务的基准测试中,@glean自研中心索引方案的选用频次约是通用MCP工具的2.5倍,而通用MCP工具的token消耗量高出约30%。
更关键的是:即便通用工具输出结果达标,也要耗用约83k tokens,Glean仅需43k tokens。
简言之,检索能力薄弱会迫使系统通过增加工具调用次数、反复推理、过量拉取数据弥补短板,这就是劣质上下文架构暗藏的隐性成本。
成熟的上下文层设计恰好相反:提前给模型精准、规整的有效信息,让token全部用在解决业务问题,而非拼凑原始素材。
2. 模型调度
智能体工作流里,并非所有步骤都需要调用前沿高阶模型做深度推理。
企业AI大量工作属于常规运维类:信息检索、检索方案规划、工具选型、结果校验、流程管控。这类环节不可或缺,但没必要全线启用成本最高的前沿模型。
多模型混合架构的价值正在于此:不是所有场景都一刀切使用轻量化模型,而是按需匹配算力层级适配任务难度。
业务规模化后,该选型逻辑愈发关键。倘若系统默认所有步骤都路由至高价前沿模型,企业等于为标准化常规工作支付顶配算力费用。
按需匹配模型规格是提升token产出率最直接的手段:高价值差异化任务保留前沿模型推理,重复标准化业务选用专用轻量化模型。
3. 持续迭代学习
企业AI系统不应每次处理同类问题都从零推演。
每一轮任务执行都会沉淀优化线索:哪些工具适配场景、哪条检索链路最优、哪些步骤属于冗余操作、哪些输出真正帮用户完成业务。
人类工作正是这套逻辑:优质成果会留存归档,避免重复造轮子,企业AI系统也应遵循该逻辑。日积月累的运行日志,能帮系统规避重复试错,高效处理同类需求。
缺少学习沉淀的系统,会不断为重复试错持续买单。
这是AI成本管控里容易被忽略的一环:能复用过往执行经验的系统,可精简无效推理、舍弃失败路径、快速收敛最优工作流,不仅优化输出质量,还能压低重复任务的token开销。
优质企业级AI会形成复利效应:完成一项任务,就能优化后续同类任务的投入成本。
4. 运行框架设计
随着智能体承接长链路、多步骤复杂任务,运行框架直接左右最终效果与token成本。
简陋的运行框架会无限制扩充有效上下文窗口,每一步迭代都不断叠加指令、工具定义、运行状态和中间结果,任务越长开销越高,输出稳定性同步下滑。
优质运行框架奉行上下文管控思路,而非无限制累积信息:按需为单步骤限定可用工具、复杂任务拆分给多个专用智能体协作、中间运行数据外置存储而非全留在即时上下文,每个模型仅载入当前必需的数据集。
设计目标不只是支撑复杂业务,更是在上下文不冗余膨胀的前提下控制成本。
AI真正的核心壁垒,是任务执行效率。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.