网易首页 > 网易科技 > 网易科技 > 正文

又一个国产模型在海外火了:下载超300万次,最大槽点是“想太多

0
分享至

出品 | 网易智能

作者 | 小爪

编辑 | 王凤枝

又一个国产开放模型,这两天在海外开发者社区里热了起来。

8月14日,阿里Qwen团队开放Qwen3.8-27B权重。这是一款27B参数稠密模型,带视觉能力,采用Apache 2.0许可。在Artificial Analysis目前的榜单中,Qwen3.8-27B与OpenAI的GPT-5.6 Luna得分相同。

又一个国产模型在海外火了:下载超300万次,最大槽点是“想太多

下载量很快涨了起来。据Hugging Face相关模型页面的统计,到8月17日前后,官方模型与社区量化版本的累计下载请求已超过300万次。

第一批实测也很快出现。开发者西蒙·威利森(Simon Willison)的测试显示,它既能在图片中定位物体,也能通过编程智能体写出并调试一个小工具。

不过,这款模型最让人意外的,反倒是"想太多"。

又一个国产模型在海外火了:下载超300万次,最大槽点是“想太多

威利森让它生成一张鹈鹕SVG图像,模型思考加输出用了21分钟;关闭推理后,完成类似任务只用了137秒(约两分钟)。面对"画一个圆"这样的简单要求,它还会主动加上动画和交互效果,做出一件更复杂的作品,却没有直接交付用户要的那个圆。

Qwen3.8-27B已经能在本地看图、写代码、驱动智能体。接下来决定它能否成为日常工具的,是速度、稳定性和调试成本。

一、300万次下载,很多人拿的是轻量版

300万次下载,并不等于有300万人把Qwen3.8-27B装进了电脑。Hugging Face统计的是相关文件的下载请求,同一名用户可能先后尝试多个版本。但一款模型发布几天就有这么密集的下载,仍然说明开发者的尝试意愿。

Qwen3.8-27B的BF16原版约为55GB,对多数个人电脑而言仍然太大。模型发布后,官方和社区很快推出了面向不同硬件和推理工具的版本:GGUF常用于LM Studio和llama.cpp,MLX面向苹果芯片,FP8和NVFP4则适配不同的英伟达显卡。

这些版本降低了本地部署的起步门槛,用户可以按照自己的显卡、内存和推理软件选择现成版本。从各页面的下载量看,这些轻量版本贡献了其中相当一部分下载请求。

llama.cpp创始人格奥尔基·格尔加诺夫(Georgi Gerganov)很快给出了现成的运行命令,覆盖DGX Spark和RTX 5090等设备。用户可以直接调用量化版本并开启多token预测加速,省去手动转换权重的步骤。其他开发者则开始尝试单张显卡、双显卡和苹果芯片,讨论重点随之落到更具体的问题上:能够保留多长的上下文,生成速度有多快,视觉功能是否稳定。

其中,约17GB的Q4版本成为关注焦点。它通过降低权重精度,把文件体积压缩到原版的三分之一左右,也让这款模型能够进入部分个人设备。不过,体积缩小并非没有代价,量化版本的输出质量、视觉表现和运行稳定性,都可能与BF16原版存在差异。

二、17GB,装下一个能干活的模型

威利森测试的是LM Studio提供的约17GB Q4_K_M量化版本。他分别在配备128GB内存的M5 Max MacBook Pro和英伟达DGX Spark上运行。

视觉测试中,他让模型识别一张照片里的两只鹈鹕,并以JSON格式返回它们的位置。模型给出的两个方框与照片中的鹈鹕基本吻合。随后,他又让Qwen编写一个网页工具:用户输入图片地址和坐标数据,网页便能把方框和标签覆盖在图片上。

又一个国产模型在海外火了:下载超300万次,最大槽点是“想太多

开启最高推理档时,模型做出了一个功能完整、但明显过度设计的界面,甚至主动绘制了一幅鹈鹕示例图。关闭推理后,它生成的页面看起来依然完整,方框位置却出现了偏差。

又一个国产模型在海外火了:下载超300万次,最大槽点是“想太多

威利森还把这个量化版本接入了编程智能体Pi。他先让模型分析Datasette项目的身份验证机制,模型读取了多个文件并给出了解释。随后,他要求模型把Pi保存的JSONL对话记录转换成Markdown,Qwen编写并测试了一段Python程序,威利森最终用这段程序发布了本次测试的对话记录。

速度是威利森提到的主要问题。威利森在LM Studio中测得的生成速度约为每秒15至30个token,明显慢于他常用的云端模型。不过改用llama.cpp并开启多token预测后,DGX Spark上的对比测试速度提高了约72%。

又一个国产模型在海外火了:下载超300万次,最大槽点是“想太多

三、显存够了,也不等于省心

约17GB只是模型文件本身的大小。真正运行时,长文本、图片处理和推理软件还会继续占用内存。即使使用拥有24GB显存的高端显卡,用户仍要考虑能够留下多少上下文、两张显卡怎样分担模型,以及视觉功能在不同推理软件里是否稳定。三组海外测试,分别给出了不同的答案。

Reddit用户Round-Comparison-675用一张RTX 4090显卡,把上下文长度开到16万,并让模型全部由GPU运行。按他的测试,生成速度约为每秒47至57个token,已经可以用于编程和其他连续任务。

又一个国产模型在海外火了:下载超300万次,最大槽点是“想太多

用户Ecstatic-Wash-7667使用两张RTX 3060 12GB显卡,在12.8万上下文、MTP2和Q4_K_XL量化设置下,测得每秒50.6个token,显存占用达到23.2/24.0GB。不过,他后来补充,不同测试得到的速度并不稳定:基准测试约为每秒36个token,实际提示词中又能接近50个token。为了给日常运行留下余量,他最终把上下文降到了11.2万。

又一个国产模型在海外火了:下载超300万次,最大槽点是“想太多

RTX 3090用户jonaddb则花了近14个小时调试。他最终把上下文长度开到13.1万,生成速度超过每秒60个token;但视觉功能起初会直接崩溃,需要调整计算精度才能正常识别一张1080P截图。对他而言,模型能力不是主要问题,显卡架构和推理软件的适配反而花掉了更多时间。

又一个国产模型在海外火了:下载超300万次,最大槽点是“想太多

三组测试共同说明,Qwen3.8-27B的量化版本已经能够承担实际任务,但离开箱即用还有一段距离。

四、"想太多"不是一句玩笑

Qwen3.8-27B提供最高、中等、较低和关闭推理等不同档位,但默认选择了最高档。复杂任务里,多想一会儿能减少中途走错方向;但遇到简单问题时,同一套设置却会把几秒钟的任务拉长到几分钟。

社区看法有分歧。有用户觉得Qwen3.8-27B相比前代进步明显,但即使把推理档位降到中等,模型仍可能思考很久,因此暂时不会把它设为日常主力。

也有人喜欢这种风格。社区实测显示,最高推理档虽然耗时明显更长,却可能换来更完整的输出。任务足够复杂时,"想得多"可能意味着少走几次回头路;但如果只是改写一句话、提取一段信息或者生成简单代码,同样的耐心就会变成负担。

云端模型多想一会儿,账单会先涨;本地运行省去了按次支付的云端接口费用,但多想一会儿,会等待更久、耗电更多、显卡更烫。Qwen3.8-27B已经允许用户调节推理强度,接下来的问题是,模型能不能根据任务难度自己判断:什么时候应该认真想,什么时候应该直接回答。

五、Meta、谷歌也在抢本地模型

今年6月,谷歌发布Gemma 4 12B,把16GB显存或统一内存作为本地运行门槛,希望它进入办公、内容处理和智能体工作流。同系列31B版本则面向编程、视觉理解和更复杂的推理任务。谷歌已经用不同规模的模型,覆盖从普通笔记本到高性能工作站的多档设备。

又一个国产模型在海外火了:下载超300万次,最大槽点是“想太多

8月10日,Meta发布30B参数的Muse Glimmer,主攻编程、工具调用和本地智能体任务。扎克伯格同日再次强调开放模型,并表示Meta将恢复发布部分开放权重模型。

又一个国产模型在海外火了:下载超300万次,最大槽点是“想太多

Qwen3.8-27B与Muse Glimmer体量接近,面向的也都是能够在个人设备运行的智能体任务;谷歌则用Gemma覆盖更宽的硬件范围。三家公司争夺的,是云端旗舰模型之下、普通小模型之上的本地使用空间。

Qwen这次最醒目的特点,是社区响应速度。模型发布后,量化版本、运行配置和排障经验几乎同步出现。Muse Glimmer和Gemma则背靠Meta、谷歌各自的研发与产品生态,这场竞争不会停留在一次模型发布上。300万次下载至少说明,很多开发者愿意先试一试。接下来更难的一步,是把这些仍需反复调试的方案,变成稳定、默认的使用路径。

延伸阅读
相关推荐
热点推荐
炸裂!妻子怀孕期间清华博士出轨:坦言女孩太漂亮,没把持住自己

炸裂!妻子怀孕期间清华博士出轨:坦言女孩太漂亮,没把持住自己

汉史趣闻
2026-08-09 10:32:37
2027款丰田凯美瑞上市 售17.18-20.98万元

2027款丰田凯美瑞上市 售17.18-20.98万元

车质网
2026-08-19 13:02:07
因为AI新版本太强,强到智谱暂时不敢开源了

因为AI新版本太强,强到智谱暂时不敢开源了

蓝字计划
2026-08-19 09:55:45
特种部队俘获30名俄军!俄媒大肆报道,暗示乌军第3军团司令已死

特种部队俘获30名俄军!俄媒大肆报道,暗示乌军第3军团司令已死

鹰眼Defence
2026-08-19 17:41:00
中企营地被砸第4天,蒙古部长终于开口:你们砸的是自己的饭碗!

中企营地被砸第4天,蒙古部长终于开口:你们砸的是自己的饭碗!

观察者海风
2026-08-19 15:22:22
终于知道为什么有这么多人怀念疫情前的生活了!看着看着就破防了

终于知道为什么有这么多人怀念疫情前的生活了!看着看着就破防了

另子维爱读史
2026-08-12 22:07:01
三方大交易曝光!湖人盼迎回戴维斯,组建东契奇+里夫斯+AD三巨头

三方大交易曝光!湖人盼迎回戴维斯,组建东契奇+里夫斯+AD三巨头

夜白侃球
2026-08-19 10:37:10
以后再遇到“嘎嘎肥”的坚决不买了!

以后再遇到“嘎嘎肥”的坚决不买了!

神牛
2026-08-19 15:57:30
右翼总统访华后,落地第一件事不按常理出牌,这波操作美国看懵了

右翼总统访华后,落地第一件事不按常理出牌,这波操作美国看懵了

雪儿爱追剧
2026-08-18 12:31:48
罗德里:我们有个群,里面都是三冠王和英超四连冠成员

罗德里:我们有个群,里面都是三冠王和英超四连冠成员

懂球帝
2026-08-19 01:10:11
新婚33天,陕西爱妻卷款逃往美国,丈夫花费9年把爱妻判刑65年

新婚33天,陕西爱妻卷款逃往美国,丈夫花费9年把爱妻判刑65年

云景侃记
2026-07-29 16:46:46
卫星实锤!90公里巨坑炸碎俄航天命脉,乌克兰火烈鸟捅到普京心窝

卫星实锤!90公里巨坑炸碎俄航天命脉,乌克兰火烈鸟捅到普京心窝

止戈军是我
2026-08-18 23:22:03
外援全装死,断供四十五天,仁爱礁破船将解体,小马科斯彻底输了

外援全装死,断供四十五天,仁爱礁破船将解体,小马科斯彻底输了

阿器谈史
2026-08-19 15:56:15
为什么你随手挂断的陌生来电,反而成了诈骗的入场券?

为什么你随手挂断的陌生来电,反而成了诈骗的入场券?

笔墨V
2026-08-17 10:37:40
就在刚刚,广东队重磅三个消息:徐杰突然受伤,教练组迎来新成员,萨姆纳提价

就在刚刚,广东队重磅三个消息:徐杰突然受伤,教练组迎来新成员,萨姆纳提价

伴你终老n
2026-08-19 08:21:15
阿根廷21岁小将开球2.65秒破门,创阿根廷最快进球纪录

阿根廷21岁小将开球2.65秒破门,创阿根廷最快进球纪录

懂球帝
2026-08-19 01:10:11
台湾女大学生来大陆游玩,看遍南北后感叹:大陆真是个好地方

台湾女大学生来大陆游玩,看遍南北后感叹:大陆真是个好地方

千秋文化
2026-08-18 20:22:38
日本F-15机队,快被中国无人机“熬干”了,日本F-15J“紧急拦截”后“紧急迫降”,起飞拦截谁?

日本F-15机队,快被中国无人机“熬干”了,日本F-15J“紧急拦截”后“紧急迫降”,起飞拦截谁?

蓝星杂谈
2026-08-19 08:05:08
五百名医生已证实:维生素B12与甲钴胺的真相,最好花点时间看看

五百名医生已证实:维生素B12与甲钴胺的真相,最好花点时间看看

路医生健康科普
2026-08-03 15:25:14
全网传错!郭德纲立案核心不是调侃红歌,官方定性藏关键细节

全网传错!郭德纲立案核心不是调侃红歌,官方定性藏关键细节

一盅情怀
2026-08-17 11:07:08
2026-08-19 19:51:00

科技要闻

宇树的悬念还在后面

头条要闻

重病男子立遗嘱将房产等留给弟弟 妻子称和两娃不知情

头条要闻

重病男子立遗嘱将房产等留给弟弟 妻子称和两娃不知情

体育要闻

拥有“儿皇梦”的罗德里,为何选择巴萨?

娱乐要闻

章子怡财路遭到质疑,套现3亿冲上热搜

财经要闻

内部反腐,让大疆错过宇树250亿收益?

汽车要闻

小米澎程N70体验 后排空间夸张亦可旋转对坐

态度原创

手机
房产
数码
时尚
军事航空

手机要闻

512GB只有32GB!山寨机死灰复燃,华为小米苹果集体躺枪了

房产要闻

涉及3800亩!海口秀英港又有大动作!

数码要闻

9499元!雷神黑武士猎刃Pro水冷台式机开售:酷睿7 230H+RTX 5060 Ti

格斗医师石铭:这不是一个女英雄的故事

军事要闻

美国防部:正在落实总统缩减美韩军演指令

无障碍浏览 进入关怀版
×