给大模型推理任务排优先级,最直觉的做法是搞一场竞价拍卖:谁出价高,谁先算。加州大学伯克利分校、TTIC 和谷歌研究团队的一篇论文给出了一个反直觉的结论——这种不受约束的优先权拍卖,会摧毁 KV 缓存局部性,把延迟推高最多 12 倍。
缓存为什么怕插队
![]()
KV 缓存是推理加速的核心资产。同一个前缀被反复命中,计算就能省下来。可一旦高优先级的请求不断插到队首,原本连续、可复用的请求序列被打散,缓存命中率随之崩塌。省下的那点排队时间,远远抵不过重新计算的开销。
换句话说,拍卖卖出去的是优先权,赔进去的是局部性。
给拍卖加一道树形约束
作者没有否定拍卖本身,而是给它套上了一个约束:用基数树(radix tree)来限制出价结构,让优先级的分配不能随意打乱缓存友好的请求顺序。在此基础上,采用 VCG 支付机制来定价。
这套「基数树约束拍卖 + VCG 支付」的组合,效果是双向的:
- 缓存命中率被保住,不再因为插队而崩盘;
- 仍然能捕获约 80% 的福利增益,拍卖该有的收益没有丢。
效率与公平不必二选一
这项工作的价值在于指出了一条中间路线。推理服务的调度长期在「谁先来谁先算」和「谁出钱多谁先算」之间摇摆,前者牺牲收益,后者牺牲性能。基数树约束的思路说明,只要把缓存局部性写进拍卖的约束条件里,两者可以同时拿到大部分好处。
对做推理基础设施的团队来说,这是一个可以直接落地的信号:调度器的设计目标不该只是排序,还得看排序会不会把缓存打碎。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.