最近几个月我发现,我订阅的 token 套餐越来越多,但是 token 好像越来越不够用。
也不知道是项目多了,还是各大厂商给的 token 缩水了。
反正钱没少花,token 焦虑反而越来越大了。
直到前几天,阿里发了 Qwen3.8-27B,官方跑分直接媲美 Claude Opus 4.6,还几乎全部是在 Claude Code 上跑出来的,而且开源,随便下载,不要钱。
热度也很夸张。发布 48 小时冲上 Hugging Face 趋势榜第一,当天在 Hacker News 登顶,LM Studio 上线 38 分钟下载破万,Ollama 单渠道 5 天 36 万下载。编程工具 Cline 宣布,上线仅 4 天,它就成了 Cline 开发者选得最多的本地模型。CNBC 和 The Information 也都专门做了报道。
![]()
Hugging Face 趋势榜,Qwen3.8-27B 排第一
Ollama,vLLM,SGLang 全是 day-0 支持,连 Cloudflare 都第一时间把它收进了 Workers AI 模型库,AMD 官方也出了 Ryzen AI Max 的部署教程。这个待遇,今年在开源模型里真没见过几次。
这激发了我的兴趣,索性直接把它装进了我的 Mac,实测下它到底有没有网上评价的那么好。
1 . 先说清楚它是什么
Qwen3.8-27B,270 亿参数,稠密模型,啥意思呢,每生成一个字,270 亿参数全员上场干活,不像有些模型只派一小队人。Apache 2.0 协议开源,权重随便下载,商用也不要钱。官方给这代定的调子叫「A New Bar for Coding and Cowork」,主打就是编程和办公协作。
它还有个 2.4 万亿参数的大哥 Qwen3.8-2.4T-A95B,这次权重也一起放出来了,这是 Qwen 第一次把 Max 级别的模型开放权重。不过 2.4T 那个开放权重版是纯文本模型,不带视觉,而且那个体量普通人根本跑不动。27B 才是你能搬回家的那个。
原生多模态,能看懂图片和视频,官方口径连小时级的长视频都能理解。注意,是看懂,不是生成,想让它画图的可以散了。
![]()
本地跑边界框检测,框出照片里的鹈鹕
比如上面这个,让模型把照片里的鹈鹕一只只框出来,框得相当准。这种能力放在 agent 流程里很值钱,识图,读文档,看截图写代码,都用得上。
上下文原生 262K,官方说用一种叫 YaRN 的技术能扩展到 1M。你可以理解为,262K 是训练出来的原装量程,1M 是给尺子末尾硬接了一段估算刻度,量是能量,精度没经过校准。所以 1M 目前只是理论值,实测大家跑到的都是 262K。
2 . 为什么都在喊「本地 Opus 4.6」
Opus 4.6 发布时候的体验和断崖式领先,相信用过的人都感同身受。所以现在社区再出什么新模型,第一反应都是拿它跟 Opus 4.6 比,它就是那把尺子。
官方模型卡上的跑分确实吓人。但先说清楚,这些全是官方自己跑的分,先打对折听。
![]()
Qwen3.8-27B 官方文本跑分表
SWE-bench Pro 61.7,旁边摆的参照物是 Claude Opus 4.6 Max 的 53.4,Terminal Bench 73.0,LiveCodeBench 90.3。
多模态这边官方口径也不弱,电脑操作 OSWorld-Verified 84.3,文档理解 OmniDocBench 91.1。官方说整体能力超过自家上一代付费模型 Qwen3.7-Plus。
纸面好看归好看,实际体感怎么样?社区这几天的实测结论比较一致:日常编程和 agent 任务,它跟云端旗舰的差距已经小到要刻意分辨才感觉得出来;真正复杂的长推理任务,云端还是更稳。
我自己实测下来,模型能力确实还不错,中文写作和基础编程完全没问题,但就是速度慢,比不上云端 API,要是真实做项目,等待时间也是成本。
第三方榜单这边也出来了,Artificial Analysis 的 Agentic Index 刚把它收录进去,51 分,排第 7。
![]()
Artificial Analysis Agentic Index 榜单,Qwen3.8 27B 以 51 分排第 7
51 分什么概念,比前代 Qwen3.6-27B 的 28 分高出一大截,也压过了 DeepSeek V4 Pro 和 GPT-5.6 Luna。但它前面还站着 Claude Opus 5,GLM-5.3,Grok 4.6 三个 59 分的。所以准确的说法是,本地模型第一次挤进了这个榜单的第一梯队,离「干翻所有闭源旗舰」还差得远。
另一个专门测 agent 复杂任务的第三方榜单 Agents' Last Exam 也出分了,27B 拿到 42.9%,保住了自家旗舰 Qwen3.8-Max 八成以上的水平,压过 GLM-5.2 和 Seed 2.1 Pro。
![]()
Agents' Last Exam 榜单,Qwen3.8-27B 拿到 42.9%
注意看这张榜,27B 那一栏底下标的是什么:Claude Code。又是 Claude Code,这个点后面第 5 节细说。
3 . 27B 凭什么塞进个人电脑
这是我觉得最值得讲的部分。
传统的稠密模型,每一层都用全注意力。啥意思呢,你可以理解为模型每读一个 token 都要记一笔账,上下文越长账越厚。这个账本叫 KV cache,很多模型长上下文跑不动,是账本先爆了,不是模型本身装不下。
Qwen3.8-27B 玩了招狠的。64 层里只有 16 层用全注意力,剩下 48 层换成一种叫 Gated DeltaNet 的线性注意力,只保留一个固定大小的状态。相当于别人每笔流水都留着,它只记余额。
效果是,KV cache 大约只有同尺寸传统模型的四分之一。27B 的身板扛 262K 上下文,靠的就是这个。
另外它内置了 MTP,一次预测多个 token,你可以理解为自带一个草稿手,先打草稿再确认,速度白捡一截。
4 . 什么电脑跑得动
直接给结论:
● 24GB 显卡或 24GB 内存的 Mac。 底线入场券,跑 4bit 量化版,大约 17GB。官方还提供了 FP8 版本,一张 RTX 5090 这种消费级游戏显卡就能顺畅跑。
● 32GB 的 Mac。 舒服档,上下文也能开得长一些。
● 48GB 以上。 可以上 8bit,质量接近无损。
● 16GB 及以下的 Mac。 别折腾了,装不下。
速度上要有心理预期,但也不用太悲观,给几个社区实测的锚点:M4 Max 跑 MLX 4bit 大约 23 tok/s,M5 Max 跑优化过的 4bit 加 MTP 能到 50-60 tok/s,RTX 5090 开 MTP 甚至能冲到 90-120 tok/s。入门档 Mac 会慢一些,聊天够用,跑长任务会嫌慢。
这里有个关键变量是 MTP,开和不开速度差接近一倍,RTX 5090 上同一个版本实测从 66 tok/s 涨到 121 tok/s。代价是 MTP 会多吃显存,压缩可用上下文,所以看到谁报了个很高的速度,先问他开没开 MTP。
我自己是 M5 Max 128G,用 Ollama 跑的 4bit 版,实测大概 25 tok/s 左右,聊天和一般任务够用,跑长任务得有耐心。内存完全不是事,跑满 262K 上下文都够。
有人可能会问,4bit 和 8bit 怎么选?一句话:内存够就 8bit,嫌慢就 4bit。4bit 快接近一倍,质量损失日常聊天感知不强,但长推理任务会偶尔露怯。
5 . 配上 Claude Code,才是完全体
开头说了,官方跑分几乎全是拿 Claude Code 跑出来的,所以我认为,这模型目前搭配上 Claude Code 效果最好。
接入也简单,Ollama 原生支持:
Bash
ollama pull qwen3.8:27b-mlx
ollama launch claude --model qwen3.8:27b-mlx
![]()
Ollama 官方模型页,Applications 第一行就是 Claude Code
Ollama 官方的模型页上,Applications 列表第一行就是 Claude Code,这待遇不是所有模型都有的。
两条命令,Claude Code 的后端就换成本地模型了,现在 Claude Code 接本地模型,完全不用担心封号的问题,没有 API 费用,没有额度焦虑,agent 随便跑,token 随便烧,代码不出你自己家门。这就是我说的 token 自由。
对代码不能出内网的公司来说,这基本是目前最值得评估的方案。
提前说个体感上的关键点:拿它接 Claude Code 这种 agent,决定流畅度的其实不是生成速度,是「读档」速度。啥意思呢,agent 每干一轮活,都得把前面的聊天记录、工具结果、代码片段从头到尾重新通读一遍才能开工,轮数越多,要重读的东西越厚。
短任务聊着很顺,上下文堆到几万字之后,每一轮开工前的等待会明显变长。所以拿来当 CC 后端,内存带宽比 tok/s 数字更值钱。我自己接入后的长期体感,跑一阵子再补。
6 . 泼点冷水
新模型发布第一周,吹捧的声音都打对折听。这模型用下来,社区也发现了一些尚待打磨的细节。
国外开发者 Simon Willison 的实测可以当个佐证。默认的 xhigh 推理档位疯狂过度思考,让它画个 SVG 圆圈,它能就「要不要加同心辅助圆」这种问题琢磨半天,一张骑自行车的鹈鹕 SVG 整整想了 21 分钟,烧掉两万多个推理 token,他文章的标题直接就是「很优秀,但默认疯狂过度思考」。
![]()
Simon Willison 的实测文章,标题就是「很优秀,但默认疯狂过度思考」
![]()
鹈鹕 SVG 和那句「Was that worth waiting 21 minutes for? Absolutely not.」
同一个提示词关掉推理,两分多钟就完事。所以日常使用,建议把 reasoning_effort 调到 medium 或者 low。
社区这边还有两个真实反馈值得说。
一个是 token 消耗。国外有人把 3.8 和上一代 3.6 并排实测,答案质量 3.8 确实赢,10 个任务赢 9 个,但代价是平均 token 消耗几乎是 3.6 的三倍。
这个缺点放在本地跑倒没那么致命,反正烧的是自己家的电,但如果你打算调 API 按量计费,这个账得算清楚。
另一个是知识截止。有人问它训练数据到什么时候,它自己答 2026 年,一追问 2024 年之后的具体事就露馅。不知道自己不知道,用的时候留个心眼。
另外提醒下,agent 跑长任务记得把输出长度配额开大,官方专门提醒了这点。
1M 上下文前面说了,目前还是 PPT 数字。
7 . 谁该上车
● 手上有 24GB 以上显卡或者 32GB 以上 Mac,想不花 API 钱跑 Opus 4.6 级别 agent coding 的,直接上。
● 公司代码不能出门的,这套方案可以认真评估。
● 电脑 16GB 内存的,看看热闹就好。
● 只是日常问答写作的,你现在用的大部分普通模型就够用,不用换。
说实话,Qwen3.8-27B 现在还替代不了我的生产主力,真正做项目,我还是会打开云端。
但它的意义不在今天。
在 token 越来越不够用的时代,本地模型第一次摸到了「能用」的门槛。
按这个速度走下去,完全够格的生产级本地模型,早晚会出现。到那时候,智能不用按月订阅,就住在你自己的电脑里。
这一定是未来发展的方向,未来我们的每个电脑,每部手机都该本地常驻一个 AI 大模型,这对端侧 AI 意味着什么,不用我多说。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.