Token堪称AI时代的数字硬通货,是AI时代的核心资产。今年世界人工智能大会的展览现场,“Token工厂”无疑成为最夺目的焦点之一,众多企业不约而同打出这面旗帜。
什么是“Token工厂”?其核心壁垒又是什么?为什么对于大众而言还是新词的“Token工厂”竞争已经热火朝天,什么样的token工厂才有可能找到自己的生存空间?
![]()
世界人工智能大会展览中的“Token工厂”。
Token工厂不止生产Token
“Token工厂”概念是由黄仁勋带火的。
今年6月,黄仁勋提出,现代AI数据中心是“生产词元(Token)的现代化工厂”。每一个词元都能够转化为代码、答案、设计方案、自动化决策或服务,从而直接转化为商业利润。
同月,国内科创公司硅基流动向港交所递交上市申请,冲刺“AI Token工厂第一股”。硅基流动表示,其主营即为通过“Token工厂”模式提供MaaS(模型即服务),该公司近一年营收同比增长超10倍。
伴随大模型能力的提升,人们对于Token的消耗量与日俱增。
![]()
世界人工智能大会展览中的“Token工厂”。
派欧云计算(上海)有限公司 (PPIO)智算业务研发副总裁李星星7月18日在参加澎湃科技聊天室直播时表示,3年前生成式大模型刚出现时,人们使用AI的方式停留在对话,即使是多轮对话,消耗的Token也仅为万级。DeepSeek推出深度思考的推理模式,展示完整思考链时,单任务的Token消耗量达到十万级。编程类智能体的涌现,让单任务的Token消耗量跃升至百万级别。PPIO的“Token工厂”业务规模也在增长,截至今年6月,其日均Token调用量超1.2万亿,较去年同期增长超8倍。
“大家通常理解的Token工厂是拿到芯片、机房,做推理,产出Token给下游厂商或渠道。”李星星介绍说,实际上,“Token工厂”并不只负责生产Token,更要解决如何交付和使用的难题,建设“Token工厂”的关键在于把Token塞进智能体,让智能体与外部世界协作,调用外部知识库和访问工具等。“以前只求响应快,现在还需要稳定的运行环境,多轮对话后确保目标不跑偏,这对Token厂商而言同样是技术上的考验。”
“前两年做算力时,大家都在做算力,说明这个领域的进入门槛比较低,转发一个DeepSeek的Token接口,也可以把自己造成一个Token工厂;今年做大规模算力的人越来越少,因为当客户细化需求后,很多人就无法提供精细的服务。”商汤大装置CGO杨松告诉澎湃科技。
目前,商汤大装置日均Token服务量达2.42万亿。商汤科技预计2026年全年服务规模实现25倍增长。商汤科技联合创始人、大装置事业群总裁杨帆将“Token工厂”比作鞋厂,造鞋很简单,但要保证质量、稳定交付、掌握供应链,每个维度都会产生能力上的差异。“Token工厂最终还需要回答一个问题,你到底是一个代工厂,还是逐渐变成一个自主品牌?这个行业需要先用代工厂的形式打磨自己的能力,未来就会看到很多新的空间。今天展会里的朋友们讲Token工厂,但他们心里想的一定不止是Token工厂。”
下一步是什么?杨帆认为是Token Plan(一种AI服务订阅计划)。
如何最大化榨干Token的价值
智能体技术火热,伴随而来的是高昂的Token账单,企业越来越重视AI支出。
美国AI搜索初创公司Perplexity首席执行官阿拉文德·斯里尼瓦斯(Aravind Srinivas)曾表示,前沿智能的未来依然光明,但不会再像过去几个月那样不计成本地投入了。能够从AI消耗的电力中提供最大经济价值的公司,最终才能获得最高的估值。
“大家现在对Token预算趋于理性,我认为这是好事。AI刚兴起时,多数公司确实存在FOMO(错失恐惧症)情绪,生怕落后而先不计成本地投入;如今理智地看待成本,说明大家开始认真评估ROI(投资回报率)。”李星星表示,这种理性并非停止投入,而是控制和优化预算。尽管算力紧缺确实存在,但通过技术手段仍能进一步压榨性能、提升算力利用效率。
“没必要在所有场景下都用最贵的模型。”李星星表示,Token智能密度决定了智能体每一步决策的质量上限,Agent Loop(智能体循环)时长决定了智能体能持续运行多久、完成多复杂的任务。为了降低智能体使用成本,同时智能完成任务,PPIO采用智能模型网关,根据任务类型智能路由,关键决策由混合模型把关提升质量,简单任务由模型调度自动分流到轻量模型,设置预算护栏和失败回退机制。最终目标是用最经济的成本,完成同样质量的任务。
清华系国产算力软件企业清程极智联合创始人师天麾表示,当前AI产业高速发展,Token作为大模型和智能体运行的核心资源,其标准化生产、高效流通、低成本应用是推动AI产业规模化落地的关键。
在清程极智展台,一款本地Token管理工具ATM(Agent Token Manager)充当了智能体与Token服务商之间的中转枢纽,统一接管各类Token服务请求, 精细化管理Token,支持Token消耗明细追溯、智能体行为记录、用量限额管控、智能模型路由、故障自动恢复、本地缓存优化等。线上AI Ping平台搭载自研毫秒级智能路由技术,动态匹配模型与算力资源,交付稳定和高性价比的Token。
![]()
世界人工智能大会展览中的“Token工厂”。
清程极智展台工作人员告诉澎湃科技,对于夜间时段用户,系统会直接路由到夜间性价比高、有折扣的大模型供应商,帮助用户节省成本。如果用户业务中代码类场景较多,系统会路由到智谱GLM-5.2等对代码任务更友好的模型。“路由平台的优势在于,平台上有几百款模型服务,依赖于底层的算力种类和工程上的优化,平台价格也会比官方更便宜。”
该工作人员介绍,目前英伟达算力价格高,年前年后价格差距较大。为了降低Token成本,要尽可能多地适配更多国产芯片,“越早适配越好,国产算力资源也很紧。”
在芯片层,今年百度在WAIC上展示了超节点最新进展。天池256吞吐性能相比上一代提升25%,并完成文心、DeepSeek、GLM、Minimax等主流模型的适配,结合推理系统优化,模型推理效率提升50%。单个天池512超节点已具备万亿参数模型训练能力。在模型层,文心5.1以业界同规模模型约6%的预训练成本实现领先效果。
![]()
天数智芯展台展出加速卡。
天数智芯则表示,通用GPU企业的持续竞争力不仅来自芯片性能,也来自面向不同负载的产品布局,以及降低部署、迁移和使用成本的软件与系统能力。硬件性能是算力产品的基础,但通用GPU能否规模化使用,还取决于软件适配、系统协同和开发生态。天数智芯以通用GPU技术路线覆盖训练、推理等场景,并通过底层软件库、模型与计算中间层释放硬件效能。在大模型适配中,算子复用率达到95%,目前已稳定运行400余种模型、数千个已有算子及100余种定制算子。通过编程接口、函数库和配套工具链,天数智芯持续完善从模型适配、集群运行到应用开发的软件支持,降低客户的平台迁移和部署成本。
为了攻克国产算力性价比、适配性、能效比等大规模商用卡点,商汤科技在异构混合推理之下,令主流国产芯片MFU(Model FLOPs Utilization)提升85%-152%,相比国产同构推理,同成本 Token产出规模扩大2.5倍。
寻找Token工厂的生存空间
“Token工厂”的商业价值已是市场共识。
在Token工厂的玩家中,大厂林立,“已经是红海市场了”,一名业内人士感叹。
根据IDC的数据,在公有云MaaS市场,按调用量计算,2025年火山引擎占据近一半份额,其次是阿里云、百度智能云、硅基流动以及移动云。其他值得关注的厂商包括腾讯云、商汤科技、华为云、天翼云等。在私有化部署市场上,传统政企客户出于数据安全、合规可控等考虑,仍然将私有化部署作为第一选择,也因此培育了众多的大模型平台私有化厂商,包括百度智能云、商汤科技、电信AI、中关村科金、创新奇智、星环科技以及中国电子云。
![]()
世界人工智能大会展览中的“Token工厂”。
大厂入场,其他“Token工厂”的生存空间在哪里?Token工厂的核心壁垒又是什么?李星星认为,必须走在大厂前面,做到模型中立、快速迭代,垂直整合Token生产、交付和使用环节,这样才有可能找到自己的生存空间。只接入某家供应商后将Token转给下游客户,这种单纯的AI中转站模式自身附加值偏低,容易随着上下游的逐步成熟而被淘汰。
除了降低Token成本,李星星认为,“Token工厂”更隐形的挑战在于模型自身的演进方向。即便“Token工厂”在工具和体验上持续迭代,下一代模型的出现仍然可能直接颠覆现有成果,这是值得Token厂商深入研判的问题。
![]()
世界人工智能大会展览中的“Token工厂”。
7月中旬,月之暗面推出2.8万亿参数开源模型Kimi K3。“我们跟头部的模型厂商都有很多的交流,从目前的趋势来看,模型越来越大,几万亿参数的模型肯定是必然的趋势。”商汤大装置首席科学家张行程告诉澎湃科技,当万亿规模、长上下文的MoE模型成为主流,就要求有巨量的存储,包括GPU的显存以及内存,计算上要形成分工,使用更加灵活的分离策略。除此之外,要和行业上下游保持开放合作,与模型公司密切配合,和硬件厂商深度绑定。为构建国产化全产业链生态,未来商汤大装置将依托“银河计划”,与行业上下游共同建设一个Token运营中心、5个万卡级国产智算集群,推动技术、产业、资本深度融合。
星环科技创始人、CEO孙元浩对澎湃科技表示,目前“Token工厂”赛道竞争激烈,根源在于Token价格与算力采购成本之间的价差过小,盈利空间逼仄。这意味着行业必须通过技术创新进一步降低推理成本,既让更多企业用得起Token,也为Token厂商留出毛利空间。
孙元浩认为,未来两三年,为了适配AI推理,硬件将迎来革命性迭代,软件体系也会全面重构。“现在的成本大家都吃不消,所以都开始想办法创新。我们现在第一步就是重构数据库,想方设法把Token成本降低,同时联合软件创新,进一步提高Token吞吐量。”
今年世界人工智能大会期间,星环科技推出GPU原生认知数据库,把数据库搬到GPU上运行。孙元浩表示,过去,大模型更多承担的是“回答问题”的角色。而今天的AI能够自主规划、分析、调用工具、执行任务,智能体成为新的数据使用者。它带来的高频数据访问让传统CPU架构数据库逐渐成为瓶颈。而GPU凭借万级并行计算单元和数TB/s级高带宽显存,更适合同时处理大量智能体发起的高并行数据负载。这类GPU原生的AI数据库可实现高吞吐、低延迟检索,以更少资源、更短时间完成同等任务,进一步降低单位计算成本,提升整体性价比,加速AI推理。
![]()
百度在世界人工智能大会上的展台。
随着智能体技术的发展,云服务要成为一套能支撑智能体大规模运行、持续进化、安全可控的全栈AI基础设施。今年5月,百度升级“芯云模体”全栈AI战略,希望用一套可以灵活组合的能力,解决用户的真实业务问题。在AI Infra上,这套全栈能力可提供每瓦性能更强、性价比更高的AI算力,让每一次训练和推理都转化成更好的智能体效果。在Agent Infra上提升单位Token的智能水平,让智能体更好地完成任务。除此之外,百度研发了KV Cache分层存储池化、近访存加速等技术,为长上下文和长时间记忆提供更优方案,提升长链路推理性能。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.