网易首页 > 网易号 > 正文 申请入驻

源神启动!一张消费级显卡跑“Opus级”Agent,Qwen3.8-27B多项榜单反超Claude

0
分享至

梦瑶 发自 凹非寺量子位 | 公众号 QbitAI

狂喜~开发者苦等已久的Qwen3.8-27B终于开!源!了!

270亿的总参数量,在官方Benchmark多项软件工程和Agent评测中的表现吧,多少又有点让Claude《危》了——

Agent编程评测SWE-bench Pro上,27B以8.3分的优势卷超Claude Opus 4.6 Max。

到了更考验真实软件工程能力的QwenSWEBench,甚至领先幅度进一步扩大到15.2分:



尺寸虽小,参数配置和模型表现配的可不孬——

原生多模态、262K原生上下文、最高100万Token扩展,重点强化的Coding、专业工作和长程Agent能力,也一项没落下。

好东西大家自然都想尝鲜一番!!

这不嘛,已经有一大波网友开始大roll特roll了。

下面这老哥用3.8-27B和3.6-27B分别做了个像素风宝塔效果,3.8-27B在色彩细节和主体结构明显更next level~



还有网友用Qwen3.8-27B做的俄罗斯方块——

甚至连空格键掉落时的屏幕抖动、消除行时出现的奖励倍增器效果也都是模型自己添加的:



甚至还有网友说:好啊好啊,那这意思是,差不多咱以后可以在本地跑「Opus级」模型了!?



Qwen这模型,多少还是有点说法的。。。



270亿参数,代码和Agent多项榜单超过Opus 4.6 Max

Qwen3.8这一代,说实话最近上新速度属实有点快。。。

而且这只27B,开发者友友们其实已经蹲挺久了。

正式开源之前社区里的《催更》就没怎么停过,也有不少人直接把它列进这一轮Qwen3.8里最值得等的开源版本。

大家之所以这么惦记,一个特别现实的原因就是——这回,自家电脑真有机会带得动了。(doge)

毕竟——总参数量就「270亿」。

换句话说,经过量化之后24GB显存的RTX 3090、4090这类显卡,都有机会把模型整卡装下~



尺寸下来了,上下文长度倒是一点没跟着缩水,原生支持262K Token上下文,还可以继续扩展到100万Token。

具体到干活场景,这一代27B重点强化的方向也很明确:

编程、专业工作、研究以及长程Agent任务,基本都是现在开发者最常拿模型狠狠干活的地方。

但!这里我特别想单独拎出来说一个能力——

「原生多模态」。

需要给友友们划个重点,Qwen3.8-27B本身就带视觉理解和解析能力。

意思就是,它除了读文字、啃代码,还能直接看图片、读PDF文档、理解图表,甚至处理视频!!!(欢呼.jpg)



尺寸够小,能往本地塞,上下文够长,能吃大工程,多模态和Agent能力又都保留了。

至于这些本事到底练到什么程度,官方榜单已经给出了一波答案。

咱们先从最适合拿来干活的两项看——代码和Agent。

在编程评测SWE-bench Pro里,Qwen3.8-27B比Claude Opus 4.6 Max高出8.3分;到了软件工程评测 QwenSWEBench,领先幅度进一步拉到15.2分。

Agent评测中面向计算机、金融、法律、医疗等专业长任务的CoWorkBench达到70.7分,也超过Opus 4.6 Max的68.2的成绩——



再看多模态能力这边,模型能力提升表现甚至更集中。

在电脑操作评测OSWorld-Verified中,Qwen3.8-27B拿到84.3分,Opus 4.6 Max是72.7。(给到Claude一个拉!)

手机操作评测AndroidWorld中,Qwen3.8-27B达到81.9分,Opus 4.6 Max是62.0,浏览器操作WebArena-Verified,则从上一代的48.8提升到了64.8——



通用多模态智能这边,也有几项维度我们可以一起看一下。

在视觉数学问题解决能力上,开启CI后,Qwen3.8-27B拿到94.6分,是图里这一排可见模型中的最高成绩,这类任务不只是识别图片里的字,还得把图形、公式、空间关系一起理解。

在通用视觉推理方面,Qwen3.8-27B开启CI后做到85.6分,相比不开CI时的65.7提升非常明显,它更偏向考模型面对普通视觉场景时,能不能从「看见东西」进一步走到「理解关系、做判断」。

这成绩也说明这代27B模型在看图、读文档和视觉推理这些任务上,模型覆盖的场景和性能表现更多更强~



好东西大家自然要一试,这不嘛,各方网友大神已经开始集体研究「这小27B模型到底该怎么跑」了。(doge)

比如下面这位友友用Qwen3.8-27B做了一个贪吃蛇游戏后,直言感觉像拥有了一个Opus级别的Agent——



还有网友直接把Qwen3.8-27B-FP8放到一张NVIDIA GH200上实测,同时跑10个真实请求,每个最高输出16K Token、上下文拉到262K。

结果首批流式Token基本都在10ms内返回,10个请求也全部正常完成,高并发和长上下文下的运行稳定性确实夯:



还有网友直言模型的多模态理解能力也非常不错。

一次性丢给它一部1935年的11分钟电影,让模型识别其中96个带时间戳的事件并逐字引用画面文字。

最终157秒完成,时间点对应到具体画面时,整部片子的误差大约只有2秒,而且是在单张GPU上跑完:



只能说,还是那个Qwen,还是不负众望啊。。。

从Thinking推理档位到上下文理解,27B还有这些功能

除了前面这些榜单表现,Qwen3.8-27B这次还有一个很实用的变化。

那就是模型到底要「想多久」,我们现在可以自己手动调了,因为27B里内置了个「推理档位」——

模型默认开启Thinking模式,同时支持reasoning_effort调节推理深度,一共分成xhigh、medium和low三档。

复杂代码、长程Agent这类任务可以把档位拉高;简单问答、摘要、轻量任务则可以降下来,优先换速度和成本。

此外Thinking本身也能直接关闭,让模型跳过推理过程直接回答,真diy私人定制了。



此外在长任务这件事上,还有一个挺实用的功能——Qwen3.8-27B默认开启了preserve_thinking

简单说,就是Agent前几轮「怎么想的」可以继续留在后面的上下文里。

比如Coding Agent连续改十几个文件,做到后面时还能沿着前面的决策继续走,少一点每轮重新捋思路的重复劳动,同时也能更好利用KV Cache。

小小的身形,想把长任务稳稳扛住,底层架构也得下点功夫。

具体来说Qwen3.8-27B一共64层,其中48层采用Gated DeltaNet线性注意力,16层保留完整Attention,基本按照「三层线性注意力+一层完整Attention」的节奏循环。

线性注意力负责降低长序列下的计算和缓存压力,完整Attention则隔几层做一次更充分的信息交互。

这样带来的最大好处就是——Qwen3.8-27B原生上下文能做到262K Token,还可以继续扩展到100万Token!!!



最后说一下大家同样比较关心的问题——怎么把模型跑起来。

其实,非常之简单。

官方已经给模型接上了Transformers、vLLM、SGLang和TokenSpeed。

如果是生产环境或者需要高吞吐,Qwen更推荐SGLang、vLLM这类专门的Serving引擎。

当然,本地玩家则可以更省事一点儿。

Hugging Face也提供量化版本入口了,大家可以直接通过大家熟悉的工具链部署。

换句话说,手里有一张高端消费级显卡或者大内存Mac,基本已经可以开始折腾这只27B了。(doge)

官方开源链接放下面了,感兴趣的友友可以直接上手搓搓~

[1]https://mp.weixin.qq.com/s/Ttv5cMD5p6DkUQWyoOsqCA

[2]https://huggingface.co/Qwen/Qwen3.8-27B
[3]https://www.modelscope.cn/collections/Qwen/Qwen38

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
问界销量腰斩:降价减配反噬,华为智驾也救不了?

问界销量腰斩:降价减配反噬,华为智驾也救不了?

周哥一影视
2026-08-14 09:18:03
人均600万到欠400亿,毁掉“天下第一村”的并非别人,是他们自己

人均600万到欠400亿,毁掉“天下第一村”的并非别人,是他们自己

混沌录
2026-07-31 23:22:05
1941 年日军一路追击国军溃兵,不料迎面撞上王牌74军,师长李天霞一个眼神警卫心领神会,一场血战令上高成为日军挥之不去的噩梦

1941 年日军一路追击国军溃兵,不料迎面撞上王牌74军,师长李天霞一个眼神警卫心领神会,一场血战令上高成为日军挥之不去的噩梦

唠叨说历史
2026-08-10 15:59:07
内部人士揭秘:莱维特辞去白宫新闻秘书的真实原因,特朗普曾挽留

内部人士揭秘:莱维特辞去白宫新闻秘书的真实原因,特朗普曾挽留

全球直击
2026-08-14 08:50:33
突发!600248,拿下11.56亿算力大单!

突发!600248,拿下11.56亿算力大单!

大众证券报
2026-08-15 13:18:17
敲诈中国10亿美元、拒绝中国飞机借道,如今这个国家又找上中国

敲诈中国10亿美元、拒绝中国飞机借道,如今这个国家又找上中国

趣文说娱
2026-08-15 05:36:44
申花VS河南首发:4外援PK5外援!李松益先发 高天意、米内罗替补

申花VS河南首发:4外援PK5外援!李松益先发 高天意、米内罗替补

我爱英超
2026-08-15 18:59:55
马琳接手陈熠场外,日本撤下张本宇,裁判也换了

马琳接手陈熠场外,日本撤下张本宇,裁判也换了

眼界看世界
2026-08-15 14:05:03
耗费20年,中国吃透了乌克兰所有军工技术,却唯独一样没办法?

耗费20年,中国吃透了乌克兰所有军工技术,却唯独一样没办法?

墨策史
2026-08-14 21:10:47
波波维奇追思会上告白:我偷师尼尔森,破了他1335胜纪录

波波维奇追思会上告白:我偷师尼尔森,破了他1335胜纪录

温柔且自由
2026-08-14 20:06:56
四强包揽!国乒三女将各显神通,逆转、零封、抗压谁是最终夺冠大热?

四强包揽!国乒三女将各显神通,逆转、零封、抗压谁是最终夺冠大热?

刘哥谈体育
2026-08-15 10:55:58
大量外国人涌入中国!不是来旅游,而是来抢占中国的医疗资源?

大量外国人涌入中国!不是来旅游,而是来抢占中国的医疗资源?

乌克兰小静
2026-08-15 03:22:47
未来10天,还将有1到2个台风生成!

未来10天,还将有1到2个台风生成!

上海黄浦
2026-08-15 18:48:53
美国老哥挑战极限健身,一点不练,光靠打药?还真让他走进赛场了啊!!

美国老哥挑战极限健身,一点不练,光靠打药?还真让他走进赛场了啊!!

英国那些事儿
2026-08-13 01:03:54
老公喜欢我的闺蜜,我喜欢闺蜜的老公,我们各玩各的互不干扰

老公喜欢我的闺蜜,我喜欢闺蜜的老公,我们各玩各的互不干扰

千秋文化
2026-08-01 20:22:13
上海购房政策微调!

上海购房政策微调!

中指研究院
2026-08-15 11:48:23
中企拆完设备刚走,印尼矿工烧了国企大楼,局势已完全失控

中企拆完设备刚走,印尼矿工烧了国企大楼,局势已完全失控

流史岁月
2026-08-15 11:52:02
动画电影《牛来》反向爆火:单日票房暴涨近90倍,现场观众吐槽“怕是连AI都生成不出来”

动画电影《牛来》反向爆火:单日票房暴涨近90倍,现场观众吐槽“怕是连AI都生成不出来”

澎湃新闻
2026-08-15 19:04:53
这4种鱼比带鱼和鲫鱼强多了!每周两次,补脑益智,增强免疫力

这4种鱼比带鱼和鲫鱼强多了!每周两次,补脑益智,增强免疫力

阿天爱旅行
2026-08-12 04:30:53
手机用完的时候一定要锁屏再放兜里,看完网友分享给我笑成塞子了

手机用完的时候一定要锁屏再放兜里,看完网友分享给我笑成塞子了

夜深爱杂谈
2026-08-14 20:28:47
2026-08-15 20:24:49
量子位 incentive-icons
量子位
追踪人工智能动态
13153文章数 176533关注度
往期回顾 全部

数码要闻

王思聪5年前配的100万电脑今天值多少钱?对比后惊了

头条要闻

票房暴涨1000倍 《牛来》因制作粗糙引爆全民猎奇围观

头条要闻

票房暴涨1000倍 《牛来》因制作粗糙引爆全民猎奇围观

体育要闻

体系球员与体系本身

娱乐要闻

宋慧乔晒自拍照 微笑拍照心情佳

财经要闻

便利蜂加盟遭立案:"0元加盟"生意被查

科技要闻

600亿美元收购落地 马斯克正式杀入

汽车要闻

红旗“家”年华现场:这一次,智能科技成了主角

态度原创

旅游
本地
时尚
教育
公开课

旅游要闻

青岛城阳蟠桃园,一园揽尽西游风华

本地新闻

黄景藏用半刀泥刻瓷都魂

复古风不流行了?今年这4种风格谁穿谁时髦

教育要闻

尽早培养孩子的社会化能力

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版