Qwen 1.5 3.8B、27B 这两个模型发布了。
其实一般来说,大家不会关注这么小的模型的,因为现在动不动就是几百 B 甚至上 T 的模型。
![]()
再加上这个时代你很少能看到 dense 模型了,因为绝大多数的模型大小都在几百个 B 以上。大一点的像 DeepSeek V4 Pro 这些模型,都到了 1.6T 级别的模型,如果全量跑的话是不可能的。
其实实际上,它们平时那个 MoE(也就是实际上激活的参数)也就是几十 B 左右。所以 Qwen 4.8-27B 这个模型,在大小上面还是非常讲究的。
我觉得现在这个后训练时代,能从最近的模型发布里面看出来,对于小模型是越来越好了。当然,这里的小模型指的是相对大小,而不是绝对大小。
我们可以简单拿几个例子来看,比如 DeepSeek V4 Pro 的正式版和 GLM 5.3。这两个模型,一个是 700 多 B,一个是 1.6T,可以说 GLM 5.3 的大小只有 DeepSeek 的一半左右。但是在多项指标的综合性能上,它却超过了 DeepSeek Pro。
这说明了什么?这说明后训练时代跟预训练时代是完全不一样的:
1. 预训练时代:大就是硬道理。你的模型参数大、数据量大,那你肯定就更强。这相当于是动物的脑子,是一个直接的物理限制——你不可能在脑容量比人家小的情况下,记的东西还比人家多。
2. 后训练时代:一个体量小一倍甚至几倍的小模型,在经过大量的后训练之后,在一些特定的任务上(比如 Agent、DeCoding 等),发挥出来的性能可能完全不逊色于大模型。
![]()
其实最简单的比较,就是 DeepSeek V4 的 Flash 和 Pro。Flash 总参数只有 Pro 的一小部分,实际激活参数也更少。按以前的理解,两者性能应该拉开非常大的差距,但实际并没有。
![]()
很多推理、Coding 和 Agent benchmark 上,Flash 往往只是比 Pro 低几个点。
这说明了一件很重要的事情:
参数依然决定模型的底座能力,但后训练正在极大缩小不同规模模型之间的实际使用差距。
大模型真正明显的优势,更多还是体现在世界知识和知识容量上。
这个很好理解。
预训练本质上是在往模型参数里“装东西”。模型越大,理论上能容纳的知识、模式和能力也越多。所以在过去,模型参数几乎就是最重要的指标之一。
但现在大家衡量模型的方式已经变了。
以前大家喜欢比 MMLU、知识问答,看的是:
这个模型到底知道多少?
现在越来越多发布会开始重点比 SWE-bench、Terminal-Bench、DeepSWE、OSWorld。
它们真正测试的是:
这个模型到底能不能把事情做完?
而这恰好是后训练最能发挥作用的地方。
GLM-5.3 就是一个非常典型的例子。
它和 GLM-5.2 使用的是同一个 Base Model,官方明确说,主要提升都来自 Post-training。
但 DeepSWE 可以从 46.2 提升到 66.9。
也就是说,模型的“脑容量”没有变,但经过更好的 Agent、Coding、工具使用和长程任务训练之后,它突然变得更会干活了。
这也是为什么我觉得 Qwen3.8-27B 很有意思。
它只有 27B Dense 参数,但现在在很多 Agent benchmark 上,已经可以接近几百 B 甚至更大模型过去才能达到的水平。
所以现在所谓“小模型的机会”,并不是说小模型突然比大模型聪明了。
而是:
当模型的基础知识已经足够以后,决定它实际能做多少事情的,越来越可能是后训练,而不只是参数量。
而 Agent 又恰好需要反复调用模型。
模型越小,推理越便宜、速度越快,同样的算力就可以跑更多次尝试,甚至同时跑多个 Agent。
所以 Qwen3.8-27B 真正值得关注的地方,并不是“27B 打败了谁”。
而是它说明:
预训练决定模型知道多少,后训练决定模型能不能把事情做成。
到了 Agent 时代,后者正在变得越来越重要。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.