网易首页 > 网易号 > 正文 申请入驻

模型越接越多 、Token越烧越快,企业AI开始进入“算账”阶段

0
分享至

智猩猩AI整理

编辑: 没方

打开 AI 工具、输入问题、回车——看起来,企业使用大模型就是一次愉快的'提问'。但很少有人知道,这轻轻一问的背后,数据可能正穿过多家服务商、跨越若干系统,在你看不见的地方流转。

当内部代码、客户资料、经营数据甚至核心知识被送进模型,这些数据经过了谁?在哪里被处理?会不会被保存?

除了上边的安全问题之外,还有另一笔越来越难算的账。

模型越来越多,Agent 越来越多,不同部门调用不同模型、占用不同算力,Token 消耗也跟着一路往上走。月底账单来了,企业还得继续追问这些 Token 到底是谁用的?花在哪个业务上?为什么突然涨了这么多?

当 AI 真正进入企业生产流程,这两件事最终都指向同一个问题:企业能不能把数据流向,以及 Token 的生产、调度、计量和运营,掌握在自己手里。

这也是 Token Factory 开始出现的原因。

在这一背景下,超聚变在 2026 国际探索者大会上给出了一套 FusionOne AI 企业级Token Factory解决方案。

01

为什么企业现在需要

自己的Token Factory?

当 AI 真正进入企业生产环境,问题开始变得越来越复杂。从超聚变自身实践来看,企业面临的压力主要集中在三个方面。

(1)资源焦虑:算力不少,但资源越来越分散。

不同部门可能分别建设资源池、部署自己的模型,同一个企业内部同时运行几十个模型版本,重复部署、重复运维的问题随之出现。

资源总量看似越来越大,但哪些算力正在被使用、哪些模型存在重复建设、哪里还有空闲资源,并不清晰。

(2)经济焦虑:AI 用得越多,Token 需求增长得越快。

企业扩大 AI 应用之后,Token 需求持续增长,但简单增加算力并不能解决全部问题。

比如一些简单任务同样调用大模型、旗舰模型,不同业务没有匹配合适的模型和算力资源,就可能造成大量算力浪费。

企业需要摸清同样一份算力到底能够生产多少 Token。

(3)价值焦虑:Token 用了很多,但这笔账很难算清楚。

不同系统可能都有自己的 Token 看板,但缺少统一的运营视图。没有统一的计量计费机制,Token 也很难进入企业预算,更难把成本准确分摊到具体部门、应用和业务。

这三类焦虑表明,企业需要一套属于自己的 Token Factory (Token工厂),来支撑 AI 应用的规模化落地。

Token Factory,是把基础设施、模型、服务与运营,熔铸成一套生产系统,而不是又一个 AI 产品的拼盘。建 Token Factory 的目的,从来不是“多产 Token”,而是在对的成本、对的结果上,产出对的 Token。

它不只是提供算力,还要把资源管理、Token 生产、计量结算和持续运营纳入同一套体系,让企业能够统一管理算力、持续提升 Token 产能,并把 Token 的成本和价值算清楚。

每家企业的工厂形态可以各不相同,但核心能力应当一致——不是同样的形状,而是同样的能力。

02

FusionOne AI,开始管理Token

过去,AI 基础设施软件更多解决的是模型怎么部署、算力怎么调度。而超聚变的 FusionOne AI 企业级 Token Factory 解决方案,则进一步从模型服务走向 Token 生产运营。

FusionOne AI 是超聚变基于自身 Token Factory 001 号客户实践沉淀出来的企业级 Token 工厂解决方案。它遵循新的 AI 价值链——Watt 到 FLOPS,FLOPS 到 Token,Token 到业务价值。

用一套统一的平台把算力基础设施、模型服务与 Token 运营三层连接起来,从数据中心到桌面、再到边缘,最终让 Token 进入具体业务创造价值,让每个企业都能"从业务所在之处起步。

那么如何能将 Token "产得出、管得住、算得清"呢,FusionOne AI有如下六大能力:

(1)把企业内部原本分散的算力组织起来

生产系统不仅要比别人快,更要护得住关键业务——核心负载,永远排在第一位。

总部、分支机构、部门乃至个人终端可能使用不同类型的 AI 硬件。FusionOne AI 可以统一接入服务器和 AI 资源池,对异构算力进行池化和调度,并通过更细粒度的资源管理,让不同模型和业务按需获得算力。

它支持 75+ AI 异构卡,并通过 1% 细粒度池化、拓扑调度等方式提高资源利用率。

(2)用同一份算力生产更多有效 Token

FusionOne AI 加入了 Smart 系列推理优化能力。

一方面,通过 SmartDecoding、SmartKVSparse、SmartKVCache 等技术针对不同模型和推理场景进行加速。另一方面,通过 SmartQoS 对不同请求进行优先级和并发管理,避免超长上下文任务拖住整个系统,也让核心业务在高并发情况下获得更稳定的服务。

双Smart技术引擎的目标并非单纯追求跑分更高,重点是把优化转化为生产级 SLA,让同等算力能够产出更多有效 Token,同时保证核心负载永不排在后面。

借助Smart系列推理加速能力,超聚变给出的测试数据显示,部分场景下首字时延最高降低 90%、有效吞吐提升 30%,超长上下文性能提升 100%+。

(3)新模型 Day0 适配

还有一个企业很在意的点是推理引擎和模型迭代得太快。于是,FusionOne AI 加入了 ModelEver Day0,把新模型的获取、验证、镜像打包和部署尽量做成标准流程,让新模型发布后能更快进入生产环境。模型可以以周为单位更新,但企业的验证一步都不能省——“跟上变化”与“守住稳定”,是同一枚硬币的两面。

(4)从模型服务走向 Token 生产运营

在 TokenOps 的世界里,每一个 Token 都被计量、被管理、被优化。

计量解决“谁用了多少”的问题,通过覆盖 多个主流模型的全链路埋点,让 Token 消耗变得清晰可见。

治理解决“怎么避免失控”的问题,通过身份、配额隔离和超支预警,管理不同部门和用户的 Token 使用。

优化则进一步回答“这些 Token 花得值不值”,根据质量和成本进行模型路由,让不同任务调用更合适的模型。

(5)让 Agent 安全稳定进入企业流程

随着 Agent 真正进入企业业务,还需要考虑越权操作、数据泄露、上下文断片和执行过程不可见等风险。

FusionOne AI 提供 FusionXray Agent Infra ,支持 Harness 型 Agent、工作流型 Agent 和自定义 Agent 接入,并通过安全沙箱、全局观测、Agent 治理和智能记忆等能力,让 Agent 更安全、稳定地进入企业流程。

(6)让 Token Factory 更快落到业务里

除了基础设施和 Token 运营本身,FusionOne AI 还通过 AI Lab 和 FusionXplay 补齐生态落地环节。

其中,AI Lab 主要承担方案验证和调优,FusionXplay 则沉淀模型、Agent、Skill 以及 AI Coding、企业办公、行业 Agent 等方案资产,让经过验证的能力可以更快复用到具体业务中。

由此,FusionOne AI 把算力调度、模型服务、Token 运营、Agent 治理和生态落地串到了一起,形成一套完整的 Token Factory 生产运营体系。

03

超聚变FusionServer “无极”架构,

升级Token Factory的中心算力底座

FusionOne AI 解决的是 Token 怎么生产、调度和运营。再往下一层,Token Factory 还需要一套稳定、高效的中心算力底座。

面向 Token 时代,服务器正在同时面对三方面变化:一是 GPU、LPU、Agentic CPU 等不同类型 xPU 快速涌现,异构计算越来越普遍;二是单芯片功耗、互联带宽持续提升,对供电、散热和互联能力提出更高要求;三是算力从数据中心不断向企业本地和边缘延伸,服务器需要适配更多形态和部署场景。

超聚变9月21日刚发布的全新的超聚变FusionServer “无极”架构(后文简称无极架构)即是为了应对变化而生的,或者说以不变应万变。


无极架构并不是某一款具体服务器,而是一套面向下一代计算基础设施的服务器架构。

其核心思路,是通过三段式模块解耦、统一接口标准以及更广泛的异构兼容能力,降低不同计算平台、不同部件和不同产品形态之间的适配成本。同时,架构还采用全新独立 BMC 模块,并实现约 90% 部件共享,支持统一管理和一站式运维。

在此基础上,无极架构面向通用计算、AI 计算和存储三大场景展开,并强调效率、可靠、灵活和多样化四项核心价值。按照超聚变公布的数据,其目标能力包括内存带宽提升 167%、AI 推理性能提升 100%、全闪存储 IOPS 提升 100%。

为了支撑越来越高的芯片功耗和系统密度,无极架构还在散热、供电和互联三个底层方向进行了系统级升级。

而此次同步发布的超聚变FusionServer 2158H V9 和 FusionServer 2258H V9,正是无极架构下率先落地的两款全新FusionServer V9 通用计算服务器。


两款产品的定位有所不同。

FusionServer 2158H V9 是 2U 单路服务器,单路最高支持 256 核、600W,兼顾主流云化和通用计算场景,并支持 AMD Venice SP8 与 SP7 双平台灵活组合,更强调性能与 TCO 之间的平衡。

FusionServer 2258H V9 则面向更高强度的计算任务,采用 2U 双路设计,最高可提供 512 核、1024 线程,聚合内存带宽达到 1.6TB/s,重点面向 HPC 超算、Agentic AI智能体 和 Cloud 等场景。

除了核心数提升,V9 这一代还进一步补强了内存、存储和 I/O。

其中,AMD Venice SP7 平台整体性能与能效较上代提升超过 80%;FusionServer 2258H V9 是率先支持PCIe 6.0 E3.s NVMe的AMD双路服务器,单盘读速约14GB/s;在IO扩展方面,双路提供最多8个PCIe槽位(含2×PCIe 6.0 x16),为400G网络与下一代加速卡预留充足通道;在散热上实现单路与双路600W高功耗稳定承载,并预留液冷演进空间。

在 Token Factory 体系中,FusionServer V9 是中心侧的重要算力支点,与 GPU 加速算力形成互补,共同托举云化业务和智能体应用的算力需求。

04

TokenBox™,把Token Factory

从数据中心搬进办公室

企业并不是所有 AI 请求都适合送往远端数据中心,像内部代码、知识库、研发资料、办公数据等内容,更强调本地处理和数据不出域。

而传统数据中心服务器需要机房、供电、散热和专业运维,较难直接搬进办公室。

因此,TokenBox™ 希望在数据中心服务器与传统工作站之间补上一层。

TokenBox™ 采用软硬一体设计,把算力、模型和应用一起交付,强调免机房、开箱即用、低噪音和本地部署。

其在主流业务负载下噪音可低至 35dB,并支持通过 Pack 方式扩展 GPU、CPU、内存和存储;单机最高可支持 1.6T 参数模型,同时支持新模型 Day0 适配和 Smart 推理加速。


TokenBox™ 主要面向 AI Coding、全流程AI(OPC)和 Token运营服务等场景。比如,一个研发团队可以用它部署自己的代码模型和知识库。对于小型企业或 OPC,也可以承载从研发、客服到财务、行政等一系列 AI 工作流。同时,它还支持 Token 计量计费、模型选择和弹性扩展。据测算,相比主流大模型云 API,TokenBox™ 约 2.5~3 年可以回本。

TokenBox™ 的这些能力在探索者大会上被搬到了现场。

在"AI Coding"场景中,8 位数字员工按 9 个阶段完成需求拆解、设计、并行编码、真实部署与自动化测试,并在发现缺陷后自动修复、复测、验收,每一步交付的文件都在大屏右侧的成果面板中实时列出、可点开查看。


在"AI 一人公司"场景中,一位总指挥同时派发六大业务工作流,50 位数字员工并发协作,右侧成果面板逐份累积六条产线的交付物,其中公众号工作流真实调用微信官方接口完成素材上传、草稿创建与发布。

整套平台基于本地部署的推理服务,支持流式输出、按角色配置模型与中英文切换。


这也让 TokenBox™ 的定位更加直观,不只是单纯把一台服务器缩小,它把 Token Factory 的生产能力从数据中心进一步下沉到办公室和边缘场景,让企业能够在更靠近数据和业务的位置,本地生产和使用 Token。

05

超聚变以自身实践成为

Token Factory的001号客户

一套 Token Factory 到底有没有用,最终还是要放进真实企业环境里验证。

超聚变选择先以身作则成为 Token Factory 的001号客户。在生产环境中打通“场景—Agent—Token—算力”的完整链路。


超聚变内部已经在研发场景下落地了49个AI智能体用例、约10款模型服务,日均 Token 消耗超过 300亿。

在AI Coding 场景,超聚变内部人均 E2E 代码产出率累计提升 44%,连续两年增长。除此之外,Token Factory 也已经进入硬件研发、投标、合同、报销、招聘等企业流程。

而上述这些数字,来自超聚变自己那座在真实生产中运转的 Token Factory。方案是经过一一验证后,才敢交付的。

Token Factory 真正跑起来之后,超聚变发现,买机器、部署平台、上线模型只是起点。

首先面临的是规划阶段的账怎么算。业务部门往往不知道自己到底会消耗多少 Token,更不知道需要多少算力。

超聚变因此做了场景化 Token 用量测算工具,根据并发人数、调用频率、输入输出长度估算 Token 需求;再结合不同模型和硬件的实测性能基线,反推出需要多少卡、多少台服务器,让预算和容量规划都有据可依。

到了建设和运行阶段,问题又变成算力怎么真正用起来。不同资源池之间需要统一调度,大模型要跨卡、跨节点运行,老旧算力也要尽可能继续发挥价值。

超聚变一方面通过多算力统一管理打破资源烟囱,用自研推理加速引擎优化路由、调度与KV Cache;另一方面自研AI网关,解决开源网关在稳定性、协议兼容和故障定位上的问题。

再往后,则是Token 怎么管、钱怎么算。

超聚变把不同部门、项目、模型和场景的 Token 消耗统一归集到一张全局看板,同时通过分级配额、实时熔断和超支预警控制预算;再用智能路由根据任务复杂度、成本和性能自动选择更合适的模型,避免改个错别字也调用最贵大模型。

最后还有一个持续治理的问题,模型越来越多、更新越来越快,怎么避免越用越乱?

一方面通过 Day0 能力让新模型发布后更快完成适配和上线;另一方面持续做模型治理,将重复版本和实例收敛,超聚变内部就将 40+ 模型版本精简到 10+ 精选模型目录,减少无效算力占用。

因此,001 号项目的价值,也在于将真实生产环境中暴露的问题沉淀成一套可复用的方法。

06

AI 基础设施的竞争,正在从“堆算力”

走向“提高 Token 产能”

过去企业建设 AI 基础设施,最直观的衡量方式是服务器数量、GPU 数量和峰值算力。

但当 AI 真正进入 Coding、办公、客服、经营分析等生产场景后,企业则更关心这些算力到底能生产多少 Token,以及 Token 能不能被更高效地生产和使用。

因此,超聚变把算力基础设施、模型服务、Token 生产与 Token 运营放进同一套体系里。FusionOne AI 、FusionServer V9 和 TokenBox™分别从软件管理、中心算力和边缘场景切入,最终要解决的,其实还是文章开头那个问题:企业的 Token,到底能不能看得见、管得住、算得清。

智能,不再是企业“买来”的东西;真正赢得未来的,是那些把 Token 生产率与治理能力掌握在自己手中的企业。你的 Token Factory,始于你的业务所在之处——不用从数据中心开始,从你当下真实负载起步即可。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
饶颖:赵忠祥与我发生关系7年,他的特殊性癖,让我身心受到伤害

饶颖:赵忠祥与我发生关系7年,他的特殊性癖,让我身心受到伤害

林轻吟
2026-09-19 16:09:02
小S去伦敦看了大S纪念长椅,跨越万里奔赴,却遗憾错过,太难过了

小S去伦敦看了大S纪念长椅,跨越万里奔赴,却遗憾错过,太难过了

观鱼听雨
2026-09-26 23:49:33
去年10月露面还精神矍铄!刘欢骤然离世,网传死因:腹泻引发心梗

去年10月露面还精神矍铄!刘欢骤然离世,网传死因:腹泻引发心梗

光辉记
2026-09-26 11:36:52
中国必须高度警惕越南将发生的分裂危机!

中国必须高度警惕越南将发生的分裂危机!

叶老四
2026-08-31 08:51:57
刘禹彤连续两场关键局被弃用是战术外原因?网友扒出教练追着说话,她却连头都不回

刘禹彤连续两场关键局被弃用是战术外原因?网友扒出教练追着说话,她却连头都不回

雪饼说
2026-09-27 10:12:20
《GTA6》女主低腰丁字裤造型抢镜 穿搭还能更大胆?

《GTA6》女主低腰丁字裤造型抢镜 穿搭还能更大胆?

游民星空
2026-09-26 15:12:26
刮中500万欧巨奖!意大利华人老哥进银行办完手续直接“人间蒸发”

刮中500万欧巨奖!意大利华人老哥进银行办完手续直接“人间蒸发”

意大利华人网0039
2026-09-26 10:02:25
与何超琼同居14年,至今没结婚没孩子没名分,地位早已碾压陈百强

与何超琼同居14年,至今没结婚没孩子没名分,地位早已碾压陈百强

翰飞观事
2026-09-10 10:06:06
男团决赛后温瑞博清空抖音所有作品,只留下“静心”,网友:已经表现很好,不必自责,加油!

男团决赛后温瑞博清空抖音所有作品,只留下“静心”,网友:已经表现很好,不必自责,加油!

丫头舫
2026-09-27 10:40:12
广州一老牌乐园,将正式停业!陪伴街坊超20年,无数人不舍:我的童年啊......

广州一老牌乐园,将正式停业!陪伴街坊超20年,无数人不舍:我的童年啊......

广州笋嘢益街坊
2026-09-26 15:51:23
“我占了天大便宜还没人能拿我怎么样!”产假复工第一天辞职,薅尽公司羊毛,还发视频得意狂笑

“我占了天大便宜还没人能拿我怎么样!”产假复工第一天辞职,薅尽公司羊毛,还发视频得意狂笑

蝴蝶花雨话教育
2026-09-24 00:05:17
“长得不好看,真考不上!”老师劝退视频火了,说得已经很委婉了

“长得不好看,真考不上!”老师劝退视频火了,说得已经很委婉了

泽泽先生
2026-08-20 15:35:06
米体:意大利战土耳其或做6处调整,巴斯托尼、弗拉泰西出战

米体:意大利战土耳其或做6处调整,巴斯托尼、弗拉泰西出战

懂球帝
2026-09-27 06:47:08
“我心里不平衡!”75年女子不甘心被认成奶奶,看完孩子被嘲讽的更狠了!

“我心里不平衡!”75年女子不甘心被认成奶奶,看完孩子被嘲讽的更狠了!

林林先生
2026-09-26 09:25:03
生产当天,刚打止痛针,总裁丈夫擦我汗珠开口:其实我已有2儿1女,孩子母亲是你闺蜜!我当场愣住他把选择权交给我:生不生随你!

生产当天,刚打止痛针,总裁丈夫擦我汗珠开口:其实我已有2儿1女,孩子母亲是你闺蜜!我当场愣住他把选择权交给我:生不生随你!

晓艾故事汇
2026-09-27 10:21:46
老蒯+彭啸透露目标!向余望展现高情商,吴曦+依木兰教泰国队做人

老蒯+彭啸透露目标!向余望展现高情商,吴曦+依木兰教泰国队做人

刀锋体育
2026-09-27 09:03:59
惊人的母子定律:一个男孩的命,看他的母亲就知道

惊人的母子定律:一个男孩的命,看他的母亲就知道

牛锅巴小钒
2026-09-27 08:37:00
马斯克看来是真不给亲爹打钱!80岁的埃罗尔·马斯克正在广东进行首次中国之旅

马斯克看来是真不给亲爹打钱!80岁的埃罗尔·马斯克正在广东进行首次中国之旅

问问马斯克AskMusk
2026-09-19 00:53:53
谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

韩小娱
2026-09-04 05:54:22
年轻人穿件印着“1945年8月15日 日本投降”的T恤逛车展,被骂成极端分子,这事儿有点荒唐

年轻人穿件印着“1945年8月15日 日本投降”的T恤逛车展,被骂成极端分子,这事儿有点荒唐

网络易不易
2026-07-11 10:38:35
2026-09-27 11:43:00
智猩猩
智猩猩
AI 技术内容与服务平台
165文章数 7关注度
往期回顾 全部

科技要闻

星舰第14飞,为什么准备绕地球六圈?

头条要闻

越南政府警告明年或出现停电 外媒:还怎么跟中国争

头条要闻

越南政府警告明年或出现停电 外媒:还怎么跟中国争

体育要闻

2-1!41岁魔笛世界波 克罗地亚欧国联开门红

娱乐要闻

刘欢被病痛裹挟,一生献给音乐与讲台

财经要闻

“为了看短剧,我妈两年花了22万 ”

汽车要闻

MAZDA EZ-60激光版上市 焕新全系11.39万元起

态度原创

教育
艺术
旅游
亲子
军事航空

教育要闻

别把新教材教成“旧模样”

艺术要闻

池田清明的人物画,有一种独特的“治愈感” !

旅游要闻

张家界七十二奇楼沉浸式非遗大秀上演

亲子要闻

姜还是老的辣

军事要闻

美官员:特朗普拒绝伊朗提议 并称或恢复对伊轰炸

无障碍浏览 进入关怀版