最近 AI 行业刮起了一场新的竞赛风,不再比谁的模型参数多,而是比谁能把算力用得更彻底。OpenAI、谷歌、智谱、Deepseek 这些巨头都盯上了推理加速,背后的原因很简单:当模型竞争进入部署阶段,让模型更快更便宜地跑起来,才是活下去的关键。
![]()
不是每家公司都有资金重造芯片,于是一个千亿级的新市场正在崛起 ——AI 基础设施(AI Infra)。它的核心逻辑很实在:已经部署的数据中心和 GPU,本身还有巨大的优化空间。
赛道里的玩家已经赚得盆满钵满:Bastion 年收入增长 20 倍,估值从 21 亿美元涨到 130 亿美元;Fireworks7 个月估值翻 4 倍,达到 175 亿美元,年化营收突破 10 亿美元。最近开源推理引擎 VLLM 和 SGLane 宣布商业化,种子轮融资都超过 1 亿美元,背后聚集了 AI 产业所有巨头和顶级风投,一场强强对决正式拉开帷幕。
![]()
GPU 的利用率,成了硅谷最新的关键词,也带出了这个千亿级市场。
单台 NVIDIA H100 机柜采购成本约 400 万美元,若利用率仅 50%,每年将白白烧掉 200 万美元。这不是危言耸听,CMU 最近对 756 块 GPU 做了 31 天的细粒度监测,覆盖 A100、H100 到 B200 的六代产品,结果显示集群整体有近 20% 的执行时间和约 11% 的能耗被浪费在等待上,推理场景的浪费更夸张,Asher code 的负载有 65% 的能耗消耗在空转,OpenAI 的 Chat 类请求也达到 52%。
![]()
很多人以为 GPU 一直很忙,其实大多数时间它都在闲等着。从用户请求进入系统,到网络传输、资源调度、模型加载、内存管理,再到最终完成推理返回结果,任何一个环节出瓶颈,GPU 就只能停下来。
AI Infra 的四层架构,决定了 GPU 的利用率高低:
第一层是能源基础设施,决定 GPU 能不能稳定运行;
第二层是计算硬件,包括 GPU、高带宽内存、高速互联等,决定理论算力上限;
第三层是系统软件,比如 Cuda 编译器、通信库、算子库,决定能不能把算力用到物理极限;
![]()
第四层是服务编排,负责协调 GPU 资源、调度任务,推理引擎、请求调度都属于这一层。
这四层里,电力、散热、硬件改造都是硬问题,优化空间已经见顶;而系统软件和服务编排是软问题,投入后能带来数倍性能提升。现在行业的注意力,已经快速转向这两个软层面。
AI Infra 四层架构中,系统软件和服务编排的优化,能带来 2-4 倍的性能提升。比如把利用率从 50% 推到 90% 以上,相当于凭空多出一台机柜,直接把浪费的成本赚回来。
![]()
那具体要怎么优化?目前所有工作都围绕四个核心问题:哪些计算不用重复做?哪些等待可以消除?哪些算力没吃满?哪些资源没协同?
解决这个问题的核心是 KV 缓存复用:把算过的内容存下来,下次直接用,不用从头算。Transformer 解码时,会把历史 token 映射成 key-value 张量,也就是键值缓存。第一次请求预填充时,把每个 token 的 KV 存下来,后续生成新 token 时,只算新的 KV 并追加,历史 KV 直接复用。
![]()
还有分布式缓存感知负载均衡器,把请求发到已有对应缓存的 GPU 上,避免重复计算。
第二个问题,等待的浪费。现在内存价格一季度涨 90%,高端显存缺货到 2027 年,但抢到的卡一半时间都在干等。
最早的推理引擎是排队制,一个算完再算下一个;后来用批处理,凑够一批一起算,但要等所有请求到齐,短请求还要等长请求,用户体验差。现在主流的连续批处理,像随时上下客的公交车,新请求随时上车,算完就下车,GPU 始终满载,能让吞吐量提升 2-4 倍。
![]()
还有计算阶段的等待,大模型推理分读入和生成两个阶段,读入阶段算力要求高,生成阶段对显存带宽敏感,过去混在同一张 GPU 里,互相拖累。现在的 prefill-decode 分离,把两个阶段拆到不同 GPU,各自用适配的硬件,通过高速网络传中间结果,Deepseek 和英伟达最新的 Dynamo 架构都在用这个方案,SGLane 也是最早支持大规模部署的引擎之一。
第三个问题,算力跑不满的问题。英伟达 H100 算力比 A100 提升数倍,但推理性能没同步涨,因为 GPU 大量时间花在数据搬运上,受限于串行解码。
目前有两个主要解决方向:一是低精度计算,把模型权重、中间激活值、KV 缓存用更小的数据格式存储或运算,减少显存占用,释放一倍算力空间;二是投机采样,用小模型先猜几个字,再让大模型一次性验证,猜对了一次生成多个字,最佳情况下能把生成速度提升 2-3 倍。
![]()
KV 缓存复用、连续批处理、PD 分离是当前三大核心优化方向。推理引擎的作用,就是把这些新技术第一时间集成,打通软件硬件四层,让优化协同起来。比如 Kernel 优化、调度优化、Cuda Graph、连续批处理等技术结合,把推理性能拉满。
![]()
除了推理优化,强化学习的兴起也带来了新的挑战。传统训练是单一流程,GPU 干同一种活,而强化学习需要交替进行推理、评估、参数更新,三种计算对硬件需求天差地别,传统框架会导致大量算力浪费。
Radisys ARC 推出的训练框架 Miles,把训练和推理放在同一个系统里考虑,让 SGLane 的推理端产出新样本,Miles 的训练端更新模型权重,形成高效的后训练闭环,减少等待和切换的浪费。目前 Miles 已经被不少前沿实验室采用。
VLLM 和 SGLane 原本是开源社区项目,靠研究者和工程师业余维护,但随着算力需求爆发,仅靠开源社区已经无法满足庞大需求,主创团队纷纷创业商业化。
![]()
和云计算改变服务器行业一样,未来 AI Infra 也可能成为整个 AI 行业共享的基础设施。现在开源模型迭代速度越来越快,但开放的只是权重,开发者依然要解决部署、显存、吞吐和调度等问题。推理引擎就像 AI 时代的操作系统,成为连接模型与芯片的关键一层。
Radisys ARC 的目标,就是让更多有想法的团队不用被 AI Infra 的门槛拖慢脚步,降低 AI 创业的难度,让更多人能做出自己的 AI 产品。当 AI Infra 的能力变成公共品,AGI 的距离就会更近一步。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.