网易首页 > 网易号 > 正文 申请入驻

连续工作16天 Qwen3.8-Max要把AI变成“同事”

0
分享至

过去两年,我们判断一个大模型够不够强,往往会问:它能不能回答复杂问题,数学推理怎么样,代码写得准不准。

但当模型能力逐渐逼近,新的问题已经变成:如果人不再守在旁边,它能不能把一件事继续做下去?

不是生成几段代码,也不是给出一份看起来完整的方案,而是自己拆解任务、调用工具、检查结果,在遇到错误后重新调整,最后交付一个真正可用的成果。



这正是阿里新一代旗舰模型Qwen3.8-Max想要回答的问题。

8月3日,Qwen团队正式发布Qwen3.8-Max。它拥有2.4万亿总参数,是目前规模最大的千问模型;但相比这个惊人的数字,更值得关注的是它将升级重点放在了自主编程、专业工作、科学研究、原生多模态和长周期任务上。

换句话说,Qwen3.8-Max不只想成为一个更聪明的聊天机器人,而是试图成为一个能够连续工作的AI同事。

2.4万亿背后

Qwen3.8-Max采用混合专家架构,也就是MoE。虽然模型总参数达到2.4万亿,但每次处理任务时,只会激活其中约950亿参数,相当于总规模的4%左右。

这并不意味着剩下的参数没有作用,而是模型会根据当前内容选择不同的专家模块参与计算。相比每次都调用全部参数,这种设计能够在扩大模型容量的同时,尽可能控制推理成本和响应速度。

所以,2.4万亿代表的是Qwen3.8-Max能够容纳的知识与能力规模,950亿激活参数则更接近一次实际推理需要动用的计算量。参数规模也不能直接等同于模型能力,真正决定体验的依然是训练质量、模型架构和任务完成效率。

不过,即便采用MoE,Qwen3.8-Max也不是普通用户能够轻松部署在个人电脑上的模型。仅按4bit精度粗略计算,完整权重就需要约1.2TB存储空间,还没有算运行时产生的额外开销。未来开放权重后,它主要仍将面向云服务商、研究机构和拥有大型计算集群的企业。

更适合个人和中小团队部署的,可能是官方同时预告的Qwen3.8-27B。

一次读完更多

Qwen3.8-Max是一款原生多模态模型,可以同时接收文字、图片和视频,输出文字结果。它拥有100万Token上下文窗口,QwenCloud公布的实际规格为最高约99.1万Token输入;开启思考模式后约为98.3万Token,单次最多可以输出约13.1万Token。

这意味着它能够一次读取大型代码仓库、数百页的行业报告、成批的法律文件,甚至较长的视频内容,而不必频繁地切割、摘要和重新拼接上下文。

当然,上下文更长并不代表模型会自动记住其中的每一个细节。真正重要的是,它能否在长上下文中找到与当前任务有关的信息,并在多轮操作后维持目标、状态和约束的一致性。

这也是Qwen3.8-Max最核心的一次升级:它不仅能够读得更多,还试图工作得更久。

从复现到发现

Qwen3.8-Max还被要求从零复现一篇机器学习论文。官方称,在没有现成代码和实验流程的情况下,模型连续工作约125小时,编写约7600行代码,完成1100多次操作和33轮GPU训练。



它先复现了论文中的6项主要结论,随后又花费约88小时测试18种新思路,最终提出的方法在AIME24数学评测上比原论文方案提高了2.7个百分点。

另一次芯片设计实验则持续约500轮交互和71次评估。模型将一套加密电路从最初的8298个逻辑门,逐步压缩至678个逻辑门,并在每一轮中根据仿真、综合与时序结果调整设计。

这些案例共同指向了一种能力:模型不再只是根据已有信息给出答案,而是能够提出假设、执行实验、获得反馈,再利用新结果修改下一步行动。



这也是“长周期任务”真正困难的地方。一次回答错了,可以重新提问;但一个运行几百轮的智能体,只要早期出现一个没有被发现的错误,后续所有努力都可能建立在错误基础上。模型必须学会检查、回退和重新规划,而不只是一直向前生成内容。

不只会写代码

“Coding and Cowork”是Qwen团队为Qwen3.8-Max设定的核心方向。这里的Cowork并不是简单地写文档、做总结,而是让模型进入法律、金融、医疗、设计和数据分析等专业流程,最终交付能够继续使用的文件或成果。



在这个过程中,Qwen3.8-Max的视觉能力也不再只是识别一张图片。

例如,在制作网页、PPT或三维场景时,模型可以先生成内容,再查看实际渲染结果,识别文字溢出、排版错位或视觉效果不符合要求的问题,随后返回代码和工具进行修改。视觉由一次性的输入,变成了贯穿规划、执行和检查过程的反馈通道。

这可能比单纯提高图片问答分数更加重要。因为人类使用电脑时,本来就是一边操作、一边观察结果,再决定下一步做什么。只有视觉真正进入行动循环,多模态模型才有机会从“看懂图片”走向“使用电脑完成工作”。

跑分并非全面领先

从Qwen团队公布的测试结果来看,Qwen3.8-Max已经进入当前第一梯队,但它并没有在所有项目上取得第一。



在考察终端环境操作能力的Terminal-Bench 2.1中,Qwen3.8-Max得到86.6分,高于Claude Opus 4.8和Claude Fable 5的84.6分,但仍略低于GPT-5.6 Sol的88.8分。

在考察论文复现能力的PaperBench中,它得到93.0分,是官方比较模型中的最高成绩;GPQA Diamond为92.6分,也处于第一梯队。

但在更加贴近大型代码仓库维护的SWE-bench Pro上,Qwen3.8-Max得到67.7分,低于Claude Fable 5的80.0分;FrontierSWE成绩为73.5分,同样落后于后者的88.8分。

这些成绩说明,Qwen3.8-Max在终端操作、研究复现、工具使用和长周期任务上表现突出,但并不能简单概括为“全面超过所有模型”。不同测试使用的智能体框架、工具权限、上下文长度和尝试次数也可能影响最终成绩。



模型发布后,Qwen3.8-Max成为当时排名最高的中国文本模型,并在视觉模型榜单中位列全球第二,仅落后一款Claude Fable 5版本。不过公开榜单变化很快,这更适合作为模型进入全球第一梯队的证明,而不是永久不变的排名。

价格与开放

在海外QwenCloud平台上,Qwen3.8-Max的API价格为每百万Token输入2美元、输出6美元,隐式缓存命中价格为每百万Token 0.25美元。开发者可以通过qwen3.8-max这一模型名称调用,并使用函数调用、结构化输出、上下文缓存以及内置搜索工具。

普通用户则可以直接通过Qwen Studio体验,Qoder和Qwen Code等编程工具也已经开始接入。

更值得关注的是,Qwen团队宣布将在正式发布后的一周内开放Qwen3.8-Max权重,同时还将发布Qwen3.8-27B开放权重模型,这将是千问Max级旗舰模型首次走向开放权重。

但“开放权重”并不完全等同于“完全开源”。模型权重可以下载,并不意味着训练数据、完整训练流程和所有工程代码都会公开。截至8月4日,Qwen3.8-Max的具体许可证和最终模型卡仍有待正式发布。

Qwen3.8-Max真正值得关注的地方,不是2.4万亿参数,也不是某一张跑分表上的第一名。

它代表着大模型竞争正在发生一次转向。



过去,我们希望AI能把一道题回答得更好;现在,我们开始要求它接过一个目标,在数百次操作、多个工具和不断变化的结果之间,把事情真正做完。

当然,一次连续16天的官方演示,并不意味着企业已经可以放心地把生产系统完全交给AI。权限控制、错误回滚、过程审计、成本管理和人工确认,依然决定了一个智能体能否真正投入使用。官方展示的长周期案例和跑分,也需要更多第三方复现与真实业务验证。

但至少,下一轮竞争的方向已经变得清晰。

未来决定一个模型价值的,可能不再只是它在一分钟内能给出多聪明的答案,而是在离开人类的持续提醒之后,它还能可靠地工作多久。

当AI从回答问题走向承担任务,我们距离真正的“数字同事”,或许又近了一步。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
3‑2险胜!这场胜利救了排管中心和赖亚文,却抹不去亚锦赛的遗憾

3‑2险胜!这场胜利救了排管中心和赖亚文,却抹不去亚锦赛的遗憾

金毛爱女排
2026-09-21 20:22:48
风光散尽!前首富黄光裕近况曝光,隐居广州豪宅静养

风光散尽!前首富黄光裕近况曝光,隐居广州豪宅静养

静若梨花
2026-08-16 10:37:49
平壤十万民众参加反美集会  巨型宣传画格外醒目 场面壮观

平壤十万民众参加反美集会 巨型宣传画格外醒目 场面壮观

那些看得见的老照片
2026-09-14 07:00:26
麦卡利斯特:没有板上钉钉的最终决定,我还有两年合同

麦卡利斯特:没有板上钉钉的最终决定,我还有两年合同

竞技风云录
2026-09-22 02:15:56
总裁妻子:你被开除了,回公司交接,下一秒我被移出工作群

总裁妻子:你被开除了,回公司交接,下一秒我被移出工作群

徐侠客有话说
2026-04-15 10:30:31
亚运场馆选手餐仅3块鸡肉,泰国教练直呼“太少了” 台风逼近4000人邮轮住宿面临考验

亚运场馆选手餐仅3块鸡肉,泰国教练直呼“太少了” 台风逼近4000人邮轮住宿面临考验

红星新闻
2026-09-20 15:40:44
院线只卖2900万,上线Netflix后狂飙31位冲进前九

院线只卖2900万,上线Netflix后狂飙31位冲进前九

时光慢旅人
2026-09-22 01:32:25
中国女排vs日本女排开球时间确定!决赛难度大,CCTV5直播:调整

中国女排vs日本女排开球时间确定!决赛难度大,CCTV5直播:调整

小犙拍客在北漂
2026-09-21 21:02:04
莫斯科这一幕震惊全世界,惨被乌克兰蜂群轰炸,遭二战以来最严重袭击

莫斯科这一幕震惊全世界,惨被乌克兰蜂群轰炸,遭二战以来最严重袭击

东方豪侠
2026-09-21 09:59:26
蓝战非到底多有钱,他的收入拆解如下

蓝战非到底多有钱,他的收入拆解如下

东方不败然多多
2026-09-19 11:04:50
医生一眼认出:“是火棉胶婴儿,快送到重症监护室!”

医生一眼认出:“是火棉胶婴儿,快送到重症监护室!”

医护健康科普
2026-09-21 09:07:03
张家齐:我生病被全红婵顶替!她比我强 奥运冠军只是头衔不能当饭吃

张家齐:我生病被全红婵顶替!她比我强 奥运冠军只是头衔不能当饭吃

念洲
2026-09-21 16:54:07
速度快193倍、成本低444倍——只做“选择题”的Jev爆火出圈

速度快193倍、成本低444倍——只做“选择题”的Jev爆火出圈

华尔街见闻官方
2026-09-21 11:15:54
集集都要打码,Starz把成人美剧拍出了新高度

集集都要打码,Starz把成人美剧拍出了新高度

来看美剧
2026-09-22 00:56:00
菲律宾急得跳脚!平陆运河刚通航,菲律宾最大代表团闻风就赶来了

菲律宾急得跳脚!平陆运河刚通航,菲律宾最大代表团闻风就赶来了

白色得季节
2026-09-20 14:41:24
狂言要赢国乒?张本智和亚运会翻车,没想到被现实狠狠上了一课

狂言要赢国乒?张本智和亚运会翻车,没想到被现实狠狠上了一课

像梦一场a
2026-09-22 01:22:15
争议!男篮将开会总结 媒体人质疑:输完球开两天会拍拍照汇报完事儿

争议!男篮将开会总结 媒体人质疑:输完球开两天会拍拍照汇报完事儿

醉卧浮生
2026-09-21 08:00:59
广州农商银行副行长陈岚任职资格获核准

广州农商银行副行长陈岚任职资格获核准

观点机构
2026-09-21 22:11:45
沃尔沃S90从40万降到22万,传统豪车售价集体腰斩

沃尔沃S90从40万降到22万,传统豪车售价集体腰斩

界面新闻
2026-09-20 10:52:07
摩根士丹利提出“关键问题”:沃什打算如何实现价格稳定

摩根士丹利提出“关键问题”:沃什打算如何实现价格稳定

华尔街见闻官方
2026-09-21 11:53:21
2026-09-22 02:36:49
CNMO科技 incentive-icons
CNMO科技
专业、有态度的手机门户
125166文章数 316416关注度
往期回顾 全部

科技要闻

吃AI红利的凡人,年薪10万美元,每天3万步

头条要闻

iPhone18第一批受害者来了 网友:24小时死机5次

头条要闻

iPhone18第一批受害者来了 网友:24小时死机5次

体育要闻

跟着华裔天才重仓AI,勇士旧将成资本大佬

娱乐要闻

张佳宁穿搭宽松小腹微凸 引发怀孕猜测

财经要闻

酒鬼酒经销商半年跑了40%

汽车要闻

全系800V/红旗司南智驾 红旗天工07预售权益价16.99万起

态度原创

健康
教育
艺术
房产
数码

专家提醒:癫痫发作别掐人中!

教育要闻

参变不分离?别慌!老师带你破解函数难题

艺术要闻

一生难得一见!国宝级书画全卷展开,看到就是赚到!

房产要闻

突发!开拍前夜,海口巨无霸宅地,突然叫停!

数码要闻

华硕商用破晓系列亮相,用Agent PC为办公降本增效

无障碍浏览 进入关怀版