网易首页 > 网易号 > 正文 申请入驻

阿里Qwen3.8正式发布,编程与办公再进化

0
分享至


今天,我们正式发布Qwen3.8-Max——Qwen家族迄今最强大的模型。下周,我们将开源Qwen3.8-Max的模型权重,同时也将开源Qwen3.8-27B模型。

Qwen 3.8-Max 基于 Qwen 3.5 的架构基础构建,参数规模扩展至2.4 万亿激活参数95B,支持100万上下文Tokens,在编程、办公、科研以及长周期任务等方面实现了全面提升。它不仅能应对更具挑战性的问题,还能更可靠地端到端完成复杂任务,输出值得信赖的成果。

现在,全球开发者都可通过千问AI平台获得Qwen3.8的API服务:国内每百万Tokens输入12元、输出36元,隐式缓存命中1.5元;海外每百万Tokens输入2美元、输出6美元,隐式缓存命中0.25美元,与海外相近智能的前沿模型比,Qwen3.8有更高性价比。

技术Blog:https://qwen.ai/blog?id=qwen3.8

API(千问AI 平台)https://www.qianwenai.com/models/qwen3.8-max

直接体验(Qwen Studio):https://chat.qwen.ai/?models=qwen3.8-max

模型性能


三方榜单

Arena放榜,Qwen3.8-Max在 Text Arena、CodeArena、VisionArena上的成绩:

Text Arena :文本能力榜单,包含数学、代码、创业写作等领域。


CodeArena : 编程能力(前端)榜单,考察多步骤推理及工具调用的编程智能体能力等。


VisionArena:视觉能力榜单,包含视觉推理等核心能力项目。


模型表现

编程能力:独立交付项目

对顶尖模型来说,今天的编程早已不是"你说需求、我写函数",而是从一个空文件夹出发,独立地把一个跨越数天的真实项目做到交付。我们用两个这样的挑战测试了 Qwen3.8-Max——每一份成果,都是它自己写代码、

自己跑测试、自己修复BUG,全程无人帮忙。

从零到有:构建自进化 Harness项目

本案例中,Qwen3.8-Max 被要求从零创建 oh-my-cli 项目,并在十天级长程自动编程中构建一套自进化 harness。它将用户反馈、先进社区实践与模型自测结果统一纳入工程循环,使需求能够被规范化为 issue、由 agent 自动领取并执行,并在代码、测试、预览和日志反馈中持续迭代。

项目完整 trace 均公开保存在 GitHub 仓库:

https://github.com/qwen-code-dev-bot/oh-my-cli

截至 2026 年 7 月 30 日,完全由 AI 自主运行约 16 天后,仓库累计留下 265 次 commits、127 个 PR 和 151 个 issues,展现出持续演进的自动编程能力。

最新研究论文的复现与超越

我们把一篇最新研究论文《Unified Data Selection for LLM Reasoning》交给模型,要求它:用代码复现论文实验,然后想办法做得更好。


复现的难点在于:Qwen3.8-Max 手里除了这篇论文和一批 GPU,别无他物,一切都得从零写起。

Qwen3.8-Max 开始完全地连续独立工作了约五天(125 小时),用约 37 个小时,就从零搭起论文里的整套训练与评测流水线,完整复现了论文的六项主要结论,并在高难数学基准上验证效果。

随后约 88 小时里,Qwen3.8-Max像人类研究员一样思考新的方法,开始跑起了科研循环:提出假设 → 写代码 → 上 GPU 跑 → 分析结果 → 再试。四轮下来,独立提出并测试了 18 种改进方向,最终找到一个超越论文原方法的新做法,在竞赛级数学基准 AIME24 上再提升 2.7 分。


最终五天下来,它写下约 7,600 行代码、执行超过 1,100 步操作、跑了 33 轮 GPU 训练——实现了论文的复现与超越。

办公助手:干得广,还要干得好

除了编程,另一条创造价值的主赛道,是那些琐碎多步骤、离不开各种工具的真实日常工作任务。让 Qwen3.8-Max 在这类工作里既干得广、又干得好,是我们的核心目标。

要做到这点,我们需要提供更强大的训练算力和更多种的工作环境,于是我们把真实世界的强化学习(RL)系统进行了拓展,还解决了拓展过程中三个重要的相互耦合挑战:


  1. 如何让工作环境多起来——让环境解耦:

    我们把环境拆成三个独立维度:任务(从单步小活到跨多天的长程工作)、工作空间(从几个文件到格式混杂的大型项目)、工具链(不同类别、版本和技能配置)。三者各自沿复杂度递进,互不牵连,环境数量就随任一维度的扩展自然倍增,不需要为每种新组合单独搭一遍。

  2. 如何判断"干没干好"——统一奖励系统

    不同活的验收方式天然不同:代码要跑通、文档要看格式、截图要核对渲染画面、操作路径本身也要审计。如果每种任务各配一套裁判,任务一多就维护不动,奖励还可能互相矛盾。我们把执行校验、文本评判、视觉检查、行为审计收进一套统一的评分标准,在更多样的RL工作环境中,模型收到的环境奖励始终一致。

  3. 如何让训练吃得稳——在线数据均衡:

    模型是一批一批训练数据的。如果某一批全是简单代码题、下一批全是高难度文档题,模型收到的反馈信号差异极大,算力堆上去也转化不成能力。均衡器在每个 batch 组装时自动按任务类型、难度、工作区和工具链配平分布,让模型每一步收到的信号是均匀的,训练算力持续、稳定地转化为能力提升。

三者共同提供了广度、可靠奖励与稳定性——将“环境 × 算力”的联合扩展,提升了一批模型在最主流的 harness工具(QwenWork / Claude Code / Codex / OpenClaw / Hermes)上胜任通用工作的能力,让模型不仅干得广,还能干得好。


图 1. 随着 RL 训练持续 scale up,Qwen3.8-Max 在数十个 in-house / public 工作基准上取得稳步、一致的性能提升。


图 2. Qwen3.8-Max 在 QwenWork、Claude Code、 Codex、OpenClaw、Hermes 等众多 harness 上取得相当的性能表现。

在数百种职业里,检验它能干多广

我们在覆盖数百种高价值职业的高频工作场景里,压力测试了Qwen3.8-Max 交付生产级成果的广度。以下是几个代表性案例:

  • 企业合规律师—— 面对数百份文档的语料,Qwen3.8-Max单次通读即标出1,284 条相关条款,全部审阅在一小时内完成。同等规模的文档审查通常需要法务助理团队协作执行约一周
  • 结构工程师—— Qwen3.8-Max 仅凭一份图纸,在浏览器中还原出30 层写字楼的抗震结构模型,周期、基底剪力、层间位移角均支持悬停实时查看。传统流程需要工程师在专业建模软件中手工搭建,通常耗时一周以上。
  • 体育数据分析师—— Qwen3.8-Max 将每名球员约8,400 个攻防回合解析为可直接使用的球员战术画像教练报告耗时仅数十分钟。传统分析团队则需手工完成战术切片、成因归纳与报告撰写,通常耗时数个工作日

一次对话,交付可盈利的端到端量化策略

Qwen3.8-Max拥有强大的动态工作流(Dynamic Workflows)构建能力,能够以编程方式驱动任务规划,精准编排大规模子智能体系统,从而把一次对话变成端到端、自动化的量化研发闭环。

论深度——从零跑通一套完整策略。 只给一句任务描述,它连续自主工作数小时,交出一套完整的 ETF 轮动策略:搭数据管道、生成候选因子(预测收益的特征信号)、多轮迭代筛选、回测验证、修正方向。

全程看证据做判断而非走固定脚本:


  • 剪枝冗余因子——当验证期指标与设计期不符时,这通常是过拟合的信号。

  • 加入多种子并集验证——当不同路径收敛到同一信号时,消除路径依赖。

  • 切换策略框架——当小截面上三模型集成不如定向合成稳健时。

论广度——把几个月的活压进一次对话。 量化研究里最耗时的环节是"试因子"——传统做法是一个研究员顺着一条思路慢慢试,试完一条再换下一条。Qwen3.8-Max 把这一步并行化了:从动量、价值、质量等 6 个方向出发,每个方向拆出 50 条研究路径,同时调度约 330 个子智能体并行跑,总共完成约 6,000 次历史回测。最终入选的因子,超额年化收益与风险之比(Sharpe)达到 0.64–1.48,预测稳定性指标(IC)一致为正,介于 0.010–0.014。

原本需要研究员数周甚至数月串行推进的工作,现在一次对话内规模化交付。这也指向一个更大的可能性:模型在长时程自主工作(long-horizon autonomous work)上的更广阔潜力。

长程任务

面对极其复杂的长周期、多约束任务,Qwen3.8-Max 展现出了超越以往的系统级自主规划能力——无论是高精密、强物理约束的芯片设计,还是高度动态、博弈激烈的商业经营,它都能靠"执行—反馈—迭代"的自适应闭环,在数千轮的超长交互中完成算法与策略的深度重构。

自主演进芯片设计,全栈反馈优化性能

Qwen3.8-Max 独立完成了芯片设计中的逻辑重构、多约束优化和后端布局全链路执行。

我们让 Qwen3.8-Max 独立完成一款 GCD/RSA 密码硬件加速器的设计——这是一类典型的高度紧凑、逻辑密集的数字电路。

在没有参考设计、没有人类干预的条件下,它在一个集成了仿真、综合、物理设计工具链的沙箱里,独立完成了从算法架构、RTL 代码到多轮优化的全过程。

单次不间断运行中,它历经约 500 轮交互、71 次评估、13 个关键里程碑,把设计从首个跑通的 8,298 门一路优化到 678 门,在所有参评模型中表现最优。即使在数百轮交互后,Qwen3.8-Max 仍能发起重大的结构性演进,而未在早期局部收益中陷入瓶颈。

更关键的是,这套前端优化在真实物理实现中同样成立。它证明了:架构级别的深度演进,可以无缝、高效地转化为更小、更快、更好布线的实体芯片。

长程经营,持续学习

E-Commerce Bench 是一个模拟 365 天长周期电商经营的基准,基于淘宝天猫真实脱敏交易数据构建,还原了 12 种店铺、60 个商品类目、近 600 家供应商、7,000 种商品的复杂生态。模型手握 ¥100,000 启动资金同时运营多家网店,要独立完成选品、供应链议价、库存管理、动态定价、退货处理等全链路决策,目标是年末总现金最大化。

Qwen3.8-Max 展现出了两样过人之处:一是持续学习——它能把和某个供应商磨出来的议价经验,泛化到同类商品上,而其他模型的议价效率往往中期就陷入瓶颈;二是前瞻规划——它在经营最初期就投入最多资金布局,让后续资产增长更快,年终大促期间净利润突破 10 万元,是第二名 GLM 5.2 的近 2.4 倍。Qwen3.8-Max 最终以高达 ¥416,252(4.16×回报)的总现金胜出,比第二名 GLM 5.2 高出 38%,相较上一代旗舰模型 Qwen3.7-Max 提升 152%。这一结果表明,Qwen3.8-Max 不仅具备长程连贯决策优势,也拥有从交易反馈中自适应学习的能力。

多模态智能体

从它所看见的一切,到它所完成的一切,Qwen3.8-Max 展示的不只是“看懂图片、文档和视频”的能力,而是一套贯穿任务全流程的视觉生产力。

看得懂:海量信息一次吃透。

超 200 页财报、复杂 PDF,跨页读懂文字、图表与版面,直接提炼结论、生成可交付的报告和网页;超 100 小时长视频,不只定位片段,还把人物、事件、时间织成一张可查询的"视频 Graph 记忆"。原本一次消化不了的海量信息,被转成可检索、可追溯、可交互的知识结构

做得出:理解之外,真能动手交付

把生活素材剪成 Vlog,把一道题变成沉浸式教学动画,把一张界面截图还原成完整前端项目,把户型图建成 Blender(三维建模软件)3D 装修效果,甚至从一句需求开发出可交互的游戏和应用。

会观察:边做边看,自己纠错

视觉能力不只在任务的输入端。执行过程中,它持续观察自己的中间产物,检查页面布局、物体朝向、空间关系、动画与交互效果;一旦发现电视放反、界面错位、效果不对,就定位偏差、重新规划、自主修正。

在数字世界里,要独立地把一个复杂任务真正做完,往往需要同时做两件事:用代码实现底层逻辑,并亲手操作界面来推进任务、观察结果。这种 混合智能体(Hybrid Agent) 能力——即 编程(Coding)与 GUI 操作 的结合——让两条路径彼此互补:编程高效且大规模地完成繁重工作,GUI 操作则触达人类所能看见、所能操作的一切,更关键的是把真实运行系统中的实际反馈带回来检查自己的产物,做到在真实、运行中的应用上验证。

为衡量这一能力,我们构建了RecreationBench——让模型面对一个正在运行的真实应用,没有源码、不能联网,只能像用户一样去点、去看、去试,然后从零复刻出整个应用,覆盖桌面、移动端和 Web 五大平台。Qwen3.8-Max 在此基准上已展现前沿水准,能靠"写代码—看效果—再改"的循环一步步逼近原版应用。

此外,我们推出Qwen-MM-Plugins,一个即插即用的多模态扩展库,让不同的 Agent 框架直接获得图像处理、视频剪辑、3D 建模等视觉能力,无需从头搭建。

用户反馈

对 Qwen3.8-Max 最真实的判断,来自真正拿它做事的人。无论是头部智能体应用平台、领先的开源算法团队,还是来自法律、金融、制造等领域的专业公司,新兴创业团队、个人开发者与学术科研者,都在把复杂、关键、长链路的任务持续交给它。

企业用户用它搭建和驱动大规模智能体系统,白领工作者把图片、手稿、视频等繁杂材料一次性交给它处理,开发者直接让它承担高强度工程任务,科研团队则用它跑通“文献—数据—仿真”的完整研究闭环。同一个模型,在不同领域、不同工作流中被反复用到“离不开”,最终得到一致的结论:Qwen3.8-Max 既能稳定承接长链路的自主任务,也能一次生成可直接交付的高质量结果。

完整性能结果

文本能力


视觉能力


总结

Qwen3.8-Max 是我们迄今最强大的模型,也是首个 Max 规模的开源权重模型。参数规模扩展至 2.4 万亿,它在编程、专业办公、长程任务与多模态智能体等方面实现全面提升——能够以极少的人工介入将复杂、开放的目标端到端完成,交付值得信赖的成果。模型权重将于下周开源,敬请期待。我们欢迎社区反馈,期待看到大家的创造。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
强肝冠军!不是枸杞,也不是山药,而是每家厨房里最不起眼的普通食材!

强肝冠军!不是枸杞,也不是山药,而是每家厨房里最不起眼的普通食材!

小谈食刻美食
2026-09-04 09:24:39
蒋万安出手,侯友宜出手,韩国瑜出手,李四川选情低迷急需郑丽文

蒋万安出手,侯友宜出手,韩国瑜出手,李四川选情低迷急需郑丽文

阿天爱旅行
2026-09-09 06:10:19
儿子考上清大4年没回家,母亲到学校去探望,招生办:查无此人

儿子考上清大4年没回家,母亲到学校去探望,招生办:查无此人

温情邮局
2025-09-28 11:57:16
搜狐创始人张朝阳,62岁未婚未育,弟弟出家,百亿家产谁继来承?

搜狐创始人张朝阳,62岁未婚未育,弟弟出家,百亿家产谁继来承?

哄动一时啊
2026-09-09 10:06:33
大开眼界!许家印当年奢靡生活曝光

大开眼界!许家印当年奢靡生活曝光

麦杰逊
2026-08-23 15:09:25
丛明晨和娇妻近照,29岁退役,老婆是1米8美女,打野球也年入百万

丛明晨和娇妻近照,29岁退役,老婆是1米8美女,打野球也年入百万

大西体育
2026-09-09 12:18:04
财信地产集团原总裁被调查

财信地产集团原总裁被调查

地产微资讯
2026-09-09 11:33:09
欧洲MVP拒绝重返NBA!回顾国王生涯称:双方都没得到公平机会

欧洲MVP拒绝重返NBA!回顾国王生涯称:双方都没得到公平机会

夜白侃球
2026-09-09 13:37:10
德国出现一把中国腰刀,被认为是伪造卖13万欧元,7年后拍出4830万人民币

德国出现一把中国腰刀,被认为是伪造卖13万欧元,7年后拍出4830万人民币

收藏大视界
2026-09-09 20:55:29
CBA兴奋剂风波!怀特塞德药检违规罚单未出炉,不会被禁外援!

CBA兴奋剂风波!怀特塞德药检违规罚单未出炉,不会被禁外援!

体坛侃侃球
2026-09-10 00:15:05
80年代我一个纺织厂女工,偷偷把半袋面粉塞给落魄男子,众人笑我疯了,十年后,他带百辆红旗车堵在厂门口求娶

80年代我一个纺织厂女工,偷偷把半袋面粉塞给落魄男子,众人笑我疯了,十年后,他带百辆红旗车堵在厂门口求娶

青青会讲故事
2026-08-08 15:19:43
U20亚洲杯仅剩三张世青赛门票,东道主中国队能抢到吗?

U20亚洲杯仅剩三张世青赛门票,东道主中国队能抢到吗?

体育全天候
2026-09-09 16:51:33
雅迪、爱玛换到九号小牛,才明白什么叫降维打击,用过就回不去了

雅迪、爱玛换到九号小牛,才明白什么叫降维打击,用过就回不去了

电动车的那些事儿
2026-08-20 08:29:06
稳定版发布进入最后倒计时,苹果iOS / iPadOS 27 RC发布

稳定版发布进入最后倒计时,苹果iOS / iPadOS 27 RC发布

IT之家
2026-09-10 03:07:07
苹果首款折叠屏iPhone Ultra即将亮相,内存短缺致起售价或上调至2199美元

苹果首款折叠屏iPhone Ultra即将亮相,内存短缺致起售价或上调至2199美元

第一财经资讯
2026-09-09 12:56:24
偷鸡不成蚀把米,女子本想起诉4岁男童摸臀,自己却先传2大噩耗

偷鸡不成蚀把米,女子本想起诉4岁男童摸臀,自己却先传2大噩耗

社会日日鲜
2026-09-09 14:59:56
欧冠大变局!巴萨 3 好 2 坏消息全曝光,旧帅反戈诺坎普暗藏冷门

欧冠大变局!巴萨 3 好 2 坏消息全曝光,旧帅反戈诺坎普暗藏冷门

林子说事
2026-09-10 01:07:06
终于知道为什么有这么多人怀念疫情前的生活了!看着看着就破防了

终于知道为什么有这么多人怀念疫情前的生活了!看着看着就破防了

另子维爱读史
2026-08-12 22:07:01
佩内洛普·克鲁兹:演《Bunker》却拒谈政治,那才叫自相矛盾

佩内洛普·克鲁兹:演《Bunker》却拒谈政治,那才叫自相矛盾

硅屿手记
2026-09-09 00:37:25
中国这招“请君入瓮”:你想查我的矿?那我就让你美国没矿可查!

中国这招“请君入瓮”:你想查我的矿?那我就让你美国没矿可查!

老头的传奇色彩
2026-09-09 04:21:11
2026-09-10 04:03:00
阿里研究院 incentive-icons
阿里研究院
推动商业互联网化
1970文章数 2182关注度
往期回顾 全部

科技要闻

苹果首款折叠屏iPhone Duo发布,15999元起

头条要闻

苹果发布首款折叠屏iPhone Duo 起售价1999美元

头条要闻

苹果发布首款折叠屏iPhone Duo 起售价1999美元

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

时尚
亲子
本地
房产
家居

女人不管多大,都可以看看这些“条纹T恤”,非常减龄又简约

亲子要闻

我不放弃,也不害怕!#彩虹糖裴曼伊#看看世界有多大#熊出没

本地新闻

宁波,中国制造的隐藏大佬

房产要闻

设计之都、中央法务区、均禾大道南侧……白云甩出3宗硬核宅地!

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版