我本来以为,显存越大越稳。
结果测完四个组合,直接打脸。
![]()
DGX Spark(121GB统一内存)跑全精度Qwen3.8-27B,单用户只有6.7 tok/s,开着投机解码也一样,基本废了。 同一台机器换上Ling-3.0-flash(INT4 MoE),立刻能到39~55 tok/s。
两张魔改48G的4090 + Ling,直接拉到145 tok/s,差不多是同机Qwen的3倍。
更扎心的是:真正决定“能同时服务多少人”的,不是算力,也不是总显存大小,而是装完模型后还剩多少空间给KV缓存。
很多人买卡只看参数表,这轮实测告诉你——推理时,带宽和激活参数量才是命门。
为什么会差这么多?
![]()
用大白话说:
- Dense模型(Qwen):27B参数,每生成一个字,27B全部要过一遍。
- MoE模型(Ling):总共127B,但每次只激活大约5B,大部分专家在睡觉。
生成文字时,GPU大部分时间不是在“算”,而是在“搬”权重。 搬得快不快,看显存带宽;激活越少,搬的量越小,速度就越快。
![]()
双4090带宽碾压Spark,Ling激活量又远小于Qwen,两个优势叠在一起,就出现了145这个数字。 但代价也很明显:Ling理论上限能到800左右,实际只拿到145,硬件利用率大概只有10%。极致的速度和极致的浪费,同时存在。
![]()
真实写代码任务里,倍数会缩水
我拿同一个网页动画任务(写代码、改、返工),在双4090上让两个模型完整跑了一遍。
代码量几乎一样(差0.3%)。 Ling用了69分钟,Qwen用了133分钟,大约1.94倍。
短提示词测出来是2.88倍,真实长会话只剩1.94倍。 上下文一长,读上下文的开销变大,MoE靠稀疏省下来的带宽优势就被稀释了。
benchmark越短越好看,真实会话越长越打回原形。
现在让我选,我会怎么选
一个人或小团队,主要写代码: 我选Qwen(Dense)。 速度慢一点(500 token大概10秒 vs Ling的3.4秒),但输出更稳、生态更成熟。写代码时,一次错误浪费的时间,远超过那几秒等待。
要做多人服务(内部工具、类豆包前端): 直接选Ling这种低激活MoE。 同一台双4090,Qwen大概撑36人到体验线(20 tok/s),Ling能到72人。成本直接砍一半。
![]()
两台机器都有的话: 别二选一。让它们分工——Qwen负责规划拆任务,Ling负责快速执行。长会话拆成短任务后,MoE的速度优势会回来。
买之前先问自己这四个问题
- 模型装不装得下?(权重 + KV空间)
- 每个token实际激活多少参数?
- 显存带宽够不够?
- 你是一个人用,还是要同时服务几十个人?
这四个问题答完,该买什么基本就清楚了。
![]()
我测的是当前配置下的真实数据。Spark的KV如果调满,人数可能还能再高;投机解码参数再调,Ling还有空间。但方向不会变。
现在让你选: 双4090还是DGX Spark? 评论区直接说,别藏着。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.