![]()
作者 | 青和
编辑 | 四月
一边是业务团队排队等算力,一边是大批算力卡在低效空转。在很多企业的机房里,这种尴尬的现实并不罕见。
过去一年多,几乎所有积极布局智能化的企业都在加紧采购计算卡。无论是英伟达 GPU,还是昇腾、海光、寒武纪、壁仞等国产 AI 芯片,都在成批进驻数据中心。然而,重金投入之后,业务一线与 IT 部门的摩擦却越来越大:
小任务占着整张卡,大任务迟迟凑不齐资源;不同批次采购的芯片,又分别割裂在不同的软件环境里。账面上的算力增加了,真正能交给业务使用的算力,却未必同步增加。等到企业开始批量部署 Agent,面对持续的模型调用与并行任务,这种“买得多却调不动”的落差就更难被忽略。
买卡之后,如何把算力真正组织调度起来,正在成为企业 AI 落地必须补上的一课。
近期,权威调研机构 IDC 发布了《中国 AI 算力管理平台技术能力评估,2026》,将资源管理、服务管理、运维、技术架构、业务场景支撑与交付服务纳入六大评估维度。其中,范式智能(前第四范式)综合评分位列第一,在资源管理、运维、技术架构及交付服务四项维度获得满分。
![]()
围绕这份评估,更值得行业追问的是:企业究竟需要怎样一套能力,才能让采购清单上的硬件算力,真正变成业务随时用得上的服务?
算力被谁“吃”掉了?
企业账面上有多少硬件,与业务实际能调动多少算力,中间隔着一整套底层工程能力。穿透表象,真金白银买来的算力,通常被耗散在三个关键断层上:
首先是异构芯片的软件壁垒。出于供应链安全,企业机房往往插着多种品牌的计算卡。但硬件进场只是第一步,底层驱动、编译环境、算子库与推理引擎各不相同。
由于缺乏跨芯片的统一抽象层,不同卡只能各自搭建独立的“烟囱集群”。跑在 A 芯片上的模型难以平移到 B 芯片,导致集群之间无法动态互援,一侧过载排队,一侧空转闲置。
其次还有整卡分配导致的“隐形浪费”。传统调度多以“整卡”为最小划拨单位。一个轻量级的调测或推理任务,哪怕只用到极少显存,也得独占一张大算力卡,造成账面显示已满、实则大半空转的“资源假溢出”。
而在分布式训练场景下,若缺乏跨节点的强协同调度,部分节点一旦等待资源,整个昂贵的集群都会被拖入低效的内耗中。
智能体带来的潮汐冲击比单纯大模型调度更具挑战。以往大模型多是固定批处理的稳态计算,而进入 Agent 时代后,业务调用演化为长链路、高频反思、多模型联动的脉冲式洪峰。
如果底层算力依然靠静态分配与人工预留,要么为了应对不可预测的峰值而盲目堆卡、承担巨额闲置成本,要么在突发流量涌入时由于缺乏动态弹性,直接导致业务卡顿甚至宕机。
把算力真正盘活
对照 IDC 给出的评估维度——算力资源管理、运维、技术架构与交付服务,会发现这些严苛的考量,对应着企业在工程落地中踩过的每一个坑。要把散落的硬件真正变成可用服务,关键在于补齐三层能力:
首先是细粒度切分与安全隔离。
整卡粗放分配必然导致浪费,但切分绝非简单的按比例切块,核心难点在于强隔离——既要通过资源共享压榨闲置算力,又要防止任务抢占拖垮核心业务。
为了攻破这道防线,行业近几年一直在探索兼顾性能与隔离的虚拟化方案。今年 7 月刚晋升为 CNCF (云原生计算基金会)孵化级项目的开源调度器 HAMi值得关注。(https://github.com/Project-HAMi/HAMi)
该项目主要由范式团队贡献,聚焦攻坚动态弹性切分、消除调度过程中的资源误判,并打通与批量调度引擎的协同,试图在复杂的生产集群里把资源损耗降到最低。
![]()
这类源自工业现场的调度方案进入全球技术主流路径,代表了行业对“精细化切分”的技术共识。
其次是大规模任务的成组协同。
分布式训练最忌讳节点各自为战。若一个任务需要数十张卡协同计算,系统却只断续分配了一部分,先跑起来的节点就会卡在原地“等米下锅”,造成昂贵的算力内耗。这就必须在调度层引入成组调度机制——将整个任务的所有节点打包(即云原生中的 PodGroup 模式),严格执行“要么全部满足,要么一个不派”,从底层机制上根绝跑跑停停的资源内耗。
最后是跨芯片的中立抽象与多轨调度。
面对多元算力,企业承担不起单一硬件绑定的风险,平台向下必须抹平不同芯片的驱动与运行时差异,向上让主流模型免改代码运行。
在落地交付中,范式将这套逻辑实体化为“独占、共享、超分”三轨资源池:让核心训练跑在独占池保稳定,将高并发推理引入超分池榨取弹性,再结合拓扑与负载动态分派。据悉,某大型政策性银行正是借由这套架构,在两地三中心的高合规要求下打通了异构算力池。
从算“卡时”到算“Token”
当底层的异构芯片被池化、切分,流失的算力被重新夺回,一个更深层的现实问题接踵而至:这套被救回来的算力,究竟该如何度量它的业务价值?
放眼整个产业,从海外云巨头到国内主流服务商,AI 基础设施的度量逻辑早已不同:从过去粗放的“按卡时租机器”,逐步转向“按 Token 用量计费”。在 Agent 高频并发的场景下,业务部门根本不关心机房里插着什么卡、跑了多少个小时,只在乎任务调用的吞吐、延迟与单次推理的 Token 成本。
如果管理视角仍停留在“卡时折旧”,算力就只是一堆笨重的机房资产,企业永远算不清 AI 的真实 ROI。
这也正是 IDC 在评估中将算力服务化与精细化运营列为关键考量的原因。
在具体实践中,范式通过 AI 网关引入了“卡时+Token”的双轨计量:向下摸清硬件的占用消耗,向上精确度量模型服务的调用产出与配额熔断。这种把算力做成“标准化流水线”的思路,也在其自身业绩中得到了验证。
2026 上半年其 API 业务收入达 4.64 亿元,同比暴增 860.8%。支撑这一增长的正是其背后的“Token 工厂”——依托HAMi vGPU 的虚拟化技术将 GPU 综合利用率从不足 30% 提升至 70%—90%,把原本沉淀在机房里的离散算力,真正转化成了稳定流动的 Token 产能。
硬件参数见顶,寻软件红利
AI 产业正在加速分水岭的到来。大模型的研发竞赛逐渐降温,企业落地与智能体深耕的竞争全面打响。
在这个阶段,狂热的“囤卡竞赛”正逐步让位于理性的“精益算料”。盲目堆砌芯片规格的边际收益正在急剧递减,由于驱动不匹配、架构不相容、调度不合理导致的隐性成本,已经成为吞噬企业研发预算的无底洞。
算力不是摆在机柜里的静态展示品,而是需要每毫秒都参与矩阵计算的生产力。
范式的演进恰恰是一个缩影:它不再只是单纯给企业交付一套私有化软件,而是依托自身的调度底座,快速向一个高效运转的“Token 工厂”转型。把沉睡的异构芯片激活,变成源源不断、低成本输出的标准化 Token 产能,这是底层工程释放出的巨大软件红利。
当国际开源社区以 CNCF Incubation 接纳来自中国的底层调度标准,当 IDC 把中国 AI 算力管理的第一名颁给坚持“不绑定芯片、深耕全栈调度”的技术提供方,行业释放出的强烈信号:拼硬件规格的时代过去了。企业 AI 落地最真实的门槛,更关键的是谁能用一套好软件,把手头每一块闲置的芯彻底盘活。
声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。
会议推荐
QCon 全球软件开发大会·2026(上海站)将于10 月 22 日—24 日举办。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。查看更多详情可扫码或联系票务经理 18514549229 进行咨询。
今日荐文
你也「在看」吗?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.