Release Note 我扫了一遍,信息量确实不小——411 次提交、212 位贡献者,其中 61 位是第一次参与。
对比一下:v0.25.0 大概 300 次提交,这次直接跳到 411。61 位新面孔这个数字更值得注意——开源社区已经从核心团队维护进入了大规模协作阶段。
DeepSeek-V4 专项优化
vLLM 团队这次对 DeepSeek-V4 做了几处针对性优化:
专用路由内核:端到端 TPOT 提升 2.94%。这个数字对应的是 PR #48660,路由内核的专项调优。
fused_topk_bias:内核提速 1.5 到 2 倍(PR #47463)。
去冗余操作:移除重复的 repeat/copy,端到端 TPOT 再提升 1.8%(PR #48137)。
DeepSeek-V4 是 MoE 架构,专家多、路由逻辑复杂、通信开销大,推理引擎处理起来并不轻松。这几项优化加在一起,实际部署中生成速度会有明显改善。
Inkling 模型家族
v0.26.0 对 Inkling 提供了完整的支持栈:
基础建模(#48799)
分段 CUDA graph(#48822)
Hopper FA4 相对位置注意力(#48858)
MTP=1 投机解码(#48869)
LoRA 支持(#48884)
ModelOpt NVFP4 量化(#48990)
特别是 NVFP4——NVIDIA 的 4-bit 浮点量化格式,可以在不显著损失精度的情况下大幅降低显存占用。如果你在评估 Inkling 模型的部署方案,v0.26.0 是第一个可以认真看的版本。
KV Cache 分层存储
之前的版本里 KV cache offloading 就有了,但一直不太成熟。这次的更新把整个链路补齐了:
完整的 offloading 性能指标监控,包括读写延迟和命中率(#45958、#47666、#47679)
对象存储作为第二级存储,支持云端 S3(#47063、#47274、#48150)
DP 副本感知的分层策略(#47987)
编码器缓存的 CPU offloading(#42433、#47423)
这套组合的意思是:GPU 显存不够时,可以把不常用的 KV cache 放到 CPU 内存甚至远程对象存储,按需取回。并发量大的时候,不需要给每个请求都塞满 GPU 显存。
Rust 前端加入多模态
vLLM 的 Rust 前端之前主要处理文本推理的调度。这次加了视频(#47959)和音频(#48554)的支持,还包括 Seed-OSS 工具解析器(#47741)和原生的 vllm-bench 基准测试工具(#48107)。
Rust 前端的核心优势:用更少的内存和更高的一致性处理并发请求调度。
Transformers 5.13.0
这次迁移到了 Transformers 5.13.0(#47867),涉及的模型有:
Olmo / Olmo2:迁移到新的 Transformers 建模后端(#48100)
MistralLarge3:迁移到 AutoWeightsLoader(#48153)
HunyuanVL:迁移到 transformers 原生 processor(#47872)
三个模型的迁移路径并不完全相同,不是一句"新的 Transformers 建模后端"能概括的。Transformers 5.x 引入了新的 AutoWeightsLoader,模型加载方式变了,vLLM 需要逐个适配所有依赖这条链路的模型。脏活累活,但做完之后后续支持新模型会更顺畅。
我的判断
411 次提交不是小数字。从 DeepSeek-V4 的专项调优、Inkling 的全栈支持、到 KV cache 分层存储的完善,这个版本确实有实质内容。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.