最近openclaw在国内火的优点离谱,脱离其实力范围的火,以至于我也要在文中加上两句才可能有流量。。。主要是我个人一直玩的是自己折腾的一套,比较放心
不过本周我会测试国产的两个claw,敬请期待。
本文继续折腾Qwen3.5 不出意外是最后一篇了。
Qwen3.5 系列我一直没有拿 vLLM 部署,,趁着周末,玩一下。
首先需要升级 vLLM,唯一需要注意的是自己的硬件及 CUDA 版本
我的系统总是有幺蛾子,所有还是用的 Docker
正常拉取镜像即可:docker pull vllm/vllm-openai:v0.17.0
我是 4090 的卡,所以选择官方 FP8
27B 权重文件 30GB
遭遇各种 OOM 之后。。。。
最终调整到了一版合适的参数,脚本以 35B 为例,27B 仅需修改模型文具地址和对应 name 即可,我只有 4 卡,所有还要测完 35B 后 stop 才能起 27B
#!/usr/bin/env bash
set -euo pipefail
MODEL_DIR="/data/models/Qwen3.5-35B-A3B-FP8"
CONTAINER_NAME="qwen35-35b-a3b-fp8"
PORT=8000
docker rm -f ${CONTAINER_NAME} 2>/dev/null || truedocker run -d \
--name ${CONTAINER_NAME} \
--gpus '"device=0,1,2,3"' \
--ipc=host \
--shm-size=16g \
-p ${PORT}:8000 \
-v ${MODEL_DIR}:/model:ro \
-e NCCL_P2P_DISABLE=0 \
-e NCCL_IB_DISABLE=1 \
-e VLLM_USE_V1=1 \
vllm/vllm-openai:v0.17.0 \
--model /model \
--served-model-name qwen3.5-35b-a3b-fp8 \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--kv-cache-dtype fp8 \
--gpu-memory-utilization 0.9 \
--max-num-seqs 4 \
--max-num-batched-tokens 8192 \
--language-model-only \
--enable-prefix-caching \
--default-chat-template-kwargs '{"enable_thinking": false}' \
--host 0.0.0.0 \
--port 8000
这里说明一下--tensor-parallel-size 4我又 4 张 4090 显卡--max-model-len 262144是我的强需求,可以稍微牺牲一点并发--kv-cache-dtype fp8这是为了降低 KV cache 内存占用,从而支持更长上下文--gpu-memory-utilization 0.9是为了给真实运行时留空间。实际部署中,除了权重和 KV cache,还会吃掉显存的还有:CUDA graph、NCCL 通信 buffer、allocator 碎片、连续 batching 带来的波动等等--max-num-seqs 4避免长上下文 + 高并发叠加把显存直接顶爆,感觉还有空间往上加--max-num-batched-tokens 8192参数控制一次调度里的总 token 规模。它过大时,会带来更高吞吐,但也会加大运行时显存波动和调度压力--language-model-only我不需要多模态,所以只要文本推理--enable-prefix-caching高效的 KV 管理和吞吐优化参数--default-chat-template-kwargs '{"enable_thinking": false}':加了思考我这配置卡的很,思考太过漫长了
而且我用的 FP8 它的思考居然是英文
实际运行,性能特别差 27B 几乎没有并发能力,35B-A3B 还可以,但是 RPS 很低,首 Token 延迟都奔 10s 了
没办法,我放弃官方 FP8,上了 4bit
然后使用了同样的部署脚本,只是它俩更省卡,2 张 4090 就能跑起来,我可以同时跑 27B 和 35B,而且我还在原代码基础上 加大了 max-num-seqs
我把它俩接入到了 openwebui,都关闭思考情况下,27B 也慢得多!看样子我之前的判断大错特错了,27 太拉垮了。
日志显示 27B 70+ t/s
35B 100+ t/s
代码能力呢,都不太能看,卧龙凤雏了
性能方面,27B 依然相当差劲,比 PF8 好多了
35B 比 FP8 提升多了,也比 27B 强多了
总结,以我的需求,暂时不想替代 Qwen3-32B,还是 32B 跟稳。
而且 3.5 还整了骚操作,把开头的
从“动态生成”变成了“静态预置”,下游对接的系统苦了。。。要么模型测,要么应用测,是要改的。
再加上它本身不支持思考与否的软关闭,这个级别能力提升也不见得能弥补这些缺点,企业级应用,我感觉很多都不太乐意升 3.5
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.