阿里巴巴Qwen团队近日发布Qwen3.8-27B,这是今年最值得关注的开源权重模型之一。这款270亿参数的稠密模型原生支持图像和视频理解,配备灵活的"思考"控制功能,在智能体任务和编程任务上的基准测试表现,已能与规模大得多的闭源模型同台竞技。
架构:混合注意力机制
![]()
Qwen3.8-27B并非简单的Transformer堆叠,而是采用了混合线性注意力与全注意力布局。大部分层使用Gated DeltaNet(一种线性注意力变体),每四个子块插入一个完整的Gated Attention块。这种设计在保持长上下文任务计算和KV缓存成本可控的同时,保留了复杂推理所需的精确全局注意力。
模型原生支持262,144个token的上下文长度,通过YaRN扩展可提升至1,000,000个token。它采用Apache 2.0许可证在Hugging Face上发布,完全开放商业使用。
核心能力升级
- 编程、智能体和研究导向的能力较Qwen3.5/3.6/3.7显著提升
- 更强的智能体执行能力——在长周期任务中实现更好的自主规划和环境反馈恢复
- 灵活的思考控制——推理默认开启但可关闭,通过reasoning_effort参数(xhigh/medium/low)调节推理深度
- 原生视觉语言理解——覆盖STEM图表、密集文档乃至小时级视频
基准测试:代际跃升明显
Qwen官方公布了与多个模型的对比数据。在DeepSWE 1.1基准上,Qwen3.8-27B得分42.2,而前代Qwen3.6-27B仅为13.3,成绩超过三倍。在QwenSWEBench上,得分提升近30个百分点。
更值得注意的是,Qwen3.8-27B在SWE-bench Pro、DeepSWE、QwenSWEBench、CoWorkBench、LiveCodeBench等多个智能体和编程基准上,击败了规模远大于它的闭源模型Opus4.6 Max。
仍有短板
Opus4.6 Max在广泛推理基准(GPQA Diamond、HLE)和原始终端智能体执行(Terminal-Bench 2.1)上仍然领先。这与它作为前沿规模参考模型的定位一致。
从Qwen3.6到Qwen3.8的代际提升幅度,在开源模型阵营中相当罕见。一个270亿参数的开源模型能在多项任务上超越更大规模的闭源对手,这对开发者来说意味着更低的部署成本和更灵活的应用可能。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.