国外媒体基于 RTX 5090 、DGX Spark 、AMD Strix Halo 等设备,使用不同推理引擎,测试了推理性能,以验证这些设备的水平,并且也能看到各个推理引擎优劣。
本文先聊 RTX 5090 的表现,RTX 5090 可以说是最强消费类GPU显卡,32GB 的 GDDR7 显存和 1.8 TB/s 的内存带宽,看上去非常强劲,此外测试机器还有 64GB 系统内存。
先看看运行在 llama.cpp 上的效果如何?采用 Unsloth Q4 量化版本的 Qwen 3.8 27B。
可以看到随着上下文的增长,TTFT(time-to-first-token)时间越来越长,在长上下文时第一个token响应居然要30分钟,如下图:
![]()
而吞吐量也下降得非常快,如下图:
![]()
考虑到 RTX 5090 本身硬件是非常突出的,llama.cpp 软件本身可能存在问题,注意上述数据都是未开启 MTP 的情况,就算开启 MTP 实际表现也不行。
接下去测试的是 vLLM,一个企业级推理引擎,和 llama.cpp 这样极致的量化推理引擎不一样,vLLM 一般使用高精度确保推理质量,在这样的情况下,即使64GB系统内存也不够,除非增加 64GB 交换空间。
vLLM 官方提供了Qwen 3.8 27B 的 NVFP4 量化版本,也有单块和双块 RTX 5090 的部署方案。
先看单块的方案,随着上下文的增加,TTFT响应还算不错,如下图:
![]()
但好在生成token速度还是线性的,保持平稳,速度大概 24 tok/s,具体如下图(没有开启 MTP):
![]()
但这种方案也就能支持 32K 上下文,如果要支持 262K 上下文,需要两块 5090,
看看生成速度,如果开启MTP,速度达到了 100-110 tok/s, 没有开启则是 70-80 tok/s, 如下图:
![]()
可见 MTP 效果还是不错的。
此外看看 TTFT 数值,MTP 在处理 Prompt 的时候性能稍微有所下降,但影响不大,如下图:
![]()
接下去看看 SGLang 推理引擎运行性能,另外一款知名的企业级推理引擎,先看看在单块 5090 的表现,生成速度如下图:
![]()
虽然不像 vLLM 那样,生成速度随着上下文变长速度保持恒定,但就算 32768 上下文,速度还有 66 tok/s,
但如果想支持超过 262K 上下文,还是要两张卡,SGLang 支持跨多 GPU 的张量并行,看看性能表现。
先看 TTFT响应,如下图:
![]()
表现和 vLLM 差不多。
接下去生成速度,如下图:
![]()
表现也和 vLLM 差不多。
总之,RTX 5090 算力强,缺点就是显存不够大,支持长上下文有点难度,生成速度也不错,尤其组合两块 RTX 5090 的时候。
此外也证明 llama.cpp 只能是一个玩具,随着上下文变长,推理速度就不可控了,所以它只能是一个 local 工具,而 vLLM 和 SGLang 则强调 Deployment,真正有生产力。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.