网易首页 > 网易号 > 正文 申请入驻

刚刚,阿里最强编程模型开源!4800亿参数,Agent分数碾Kimi K2,训练细节公开

0
分享至

智东西7月23日报道,就在刚刚,阿里巴巴Qwen团队开源了其最新一代旗舰编程模型Qwen3-Coder-480B-A35B-Instruct。Qwen团队称,这是该团队迄今为止最强大的开源智能体编程模型,拥有480B参数,激活参数为35B,原生支持256K上下文,并可通过外推扩展至100万上下文(输入),其最大输出为6.5万token

在基准测试中,Qwen3-Coder在编程和智能体任务上拥有不错的性能,于Agentic Coding(智能体编程)、Agentic Browser-Use(智能体浏览器使用)和Agentic Tool-Use(智能体工具调用)三类任务中获得了开源SOTA超过Kimi K2、DeepSeek V3等开源模型和GPT-4.1等闭源模型,并可与Claude Sonnet 4这一以编程能力著称的模型相媲美

Qwen3-Coder将提供多种尺寸,本次开源的是其最强大的变体,其参数量超过了阿里旗舰模型Qwen3的235B(2350亿),小于Kimi K2的1T(1万亿)。据阿里官方介绍,借助Qwen3-Coder,刚入行的程序员一天就能完成资深程序员一周的工作,生成一个品牌官网最快只需5分钟

除了模型之外,Qwen还开源了一个由Gemini Code分叉而来的智能体编程命令行工具——Qwen Code,这一工具进行了定制提示和函数调用协议的适配,能更充分的释放Qwen3-Coder在智能体编程任务上的能力。

这一模型已在阿里云旗下大模型服务平台百炼上线,其API采用了阶梯计费的方式,根据输入token量调整价格。在256K~1M一档,其输入价格为6美元/百万token,输出价格为60美元/百万token。相比之下,Claude Sonnet 4的输入输出价格分别为3美元/百万token、15美元/百万token,与Qwen3-Coder 128k~256k一档的价格持平。

Qwen3-Coder也已在Qwen Chat网页版上线,用户可免费体验。此外,其480B版本已在Hugging Face、魔搭等开源社区发布,可供下载和本地部署。Qwen还在一篇博客文章中详细分享了模型的技术细节。

模型开源地址:https://huggingface.co/Qwen

Qwen Code开源地址:https://github.com/QwenLM/qwen-code

博客地址:https://qwenlm.github.io/blog/qwen3-coder/

一、深夜上线Qwen Chat,海外网友已经玩疯了

在Qwen团队官宣Qwen3-Coder发布前,这一模型已经悄然在Qwen Chat官网上线,手速快的海外网友们贡献了一批实测案例。

这一案例让Qwen3-Coder打造一个Wordle单词游戏,规则是在六次尝试中猜出一个长度为5个字母的单词。最终,Qwen3-Coder交付的游戏页面和源代码如下。

提供案例的网友称,Qwen3-Coder在指令遵循、UI设计、动画方面的能力惊人,大部分测试结果一次就跑通了,完全不需要推理。不过,在Wordle游戏设计这一任务上,Qwen并没有使用单词解析器,也没有引用来源,而是决定自行枚举所有5个字母的单词。

在一则找不同游戏的开发案例中,可以看到与昨日发布的Qwen3-235B-A22B-2507相比,Qwen3-Coder在审美和完成度上要明显好于前者。

智东西则尝试让Qwen3-Coder开发一个中英文术语库,并支持增删改查的基础功能。可以直观感受到,由于并未开启推理,Qwen3-Coder的开发速度极快,20多秒便完成了初步结果,在对其生成结果进行进一步修改时,速度同样较快。

其最终生成的结果从UI角度上看的确美观清晰,功能运转正常,不过并没有遵循提示词中使用PHP+MySQL进行开发的指令。其最终交付的结果作为功能演示、原型展示完全足够,但在真实部署场景中的可扩展性还需进一步优化。

智东西还让Qwen3-Coder给自己出了一道3D HTML开发题,内容是创建一个3D旋转的立方体展示台,六个面显示不同颜色,自动旋转,添加光照效果和阴影等。Qwen3-Coder交付的结果完成度不错,基本实现了主要功能,旋转动效、阴影等处理到位。

编程能力之外,Qwen3-Coder还提供了许多其他的玩法,包括图像生成、视频生成等,并支持文档、图片、视频、音频等内容的上传,这可能是通过工具调用实现的。

正式发布后,Qwen官方也提供了Qwen3-Coder的部分用例。

例如,可以让其打造一个基于物理的烟囱拆除模拟,具有受控爆炸。

打造可互动的太阳系模拟,行星之间的关系基本准确。

开发出的网页小游戏完成度不错。

二、预训练仍有扩展空间,在20000个独立环境进行强化学习

Qwen团队在技术博客中分享了Qwen3-Coder的部分训练细节,该团队认为,目前预训练仍有进一步的扩展空间。

预训练阶段,Qwen3-Coder使用了7.5万亿token数据,其中代码占比70%,因此,模型在编程方面表现出色,同时也保留了通用和数学能力。

上下文方面,Qwen3-Coder原生支持256K上下文,并可通过YaRN扩展至1M,针对仓库规模和动态数据(例如拉取请求)进行了优化,从而适配智能体编程场景。

Qwen3-Coder的上一代模型Qwen2.5-Coder被运用于扩展合成数据,具体而言,Qwen2.5清洗并重写了噪声数据,提升了整体数据质量。

后训练阶段,Qwen团队认为,与普遍关注竞赛级代码生成不同,所有代码任务都天然适合执行驱动(execution-driven)的大规模强化学习。该团队在更广泛的现实世界编程任务上扩大了代码强化学习训练规模。

通过自动扩展多样化编程任务的测试用例,Qwen团队创建了高质量的训练实例,进一步释放了强化学习的潜力。这不仅提高了代码执行成功率,还为其他任务带来了收益。

这也启发该团队进一步探索难以解决,却易于验证的任务类型,这有望成为强化学习的沃土。

在现实世界的软件工程任务(例如 SWE-Bench)中,Qwen3-Coder必须与环境进行多轮交互,涉及规划、使用工具、接收反馈和做出决策。在Qwen3-Coder的后训练阶段,Qwen团队引入了长视距强化学习(智能体强化学习),鼓励模型通过使用工具进行多轮交互来解决现实世界任务。

智能体强化学习的关键挑战在于环境扩展。为解决这一问题,该团队构建了一个可扩展的系统,能够并行运行20000个独立环境。该基础设施为大规模强化学习提供了必要的反馈,并支持大规模评估。

因此,Qwen3-Coder在SWE-Bench Verified中实现了开源模型中的最佳性能,且无需使用推理(测试时扩展)。

同时开源的Qwen Code是一个用于研究目的的命令行界面(CLI)工具,基于Gemini CLI开发,针对Qwen-Coder模型进行了增强的解析器和工具支持。

除了Qwen Code,还可以使用Claude Code与Qwen3-Coder一起编程。只需在Dashscope平台上申请一个API密钥,并安装Claude Code即可开始编程。

结语:更多尺寸即将推出,探索编程智能体自我提升

在Cursor断供Claude等适用于编程领域的模型之际,Qwen3-Coder的本次开源给国内开发者提供了最新的替代选项。

Qwen团队透露,他们仍在努力提高Coding Agent的性能,旨在让它承担软件工程中复杂和乏味的任务,从而释放人类的生产力。

Qwen3-Coder的更多模型尺寸即将推出,可维持部署成本和性能之间的平衡。此外,该团队正在探索Coding Agent是否可以实现自我提升。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
一定要大量读书:一个人修行高不高,就看他有没有读过这10本书

一定要大量读书:一个人修行高不高,就看他有没有读过这10本书

欣辰读书
2026-05-15 22:59:03
夏天,遇见这肉再贵也要吃,比牛羊肉补,一周吃2次,健脾强免疫

夏天,遇见这肉再贵也要吃,比牛羊肉补,一周吃2次,健脾强免疫

阿龙美食记
2026-06-03 14:09:28
狗屎运爆棚!6月转运起飞,喜从天降,财富说来就来的3个生肖

狗屎运爆棚!6月转运起飞,喜从天降,财富说来就来的3个生肖

毅谈生肖
2026-06-03 11:31:13
尾盘罕见,不到400万元,301418拉升逾16%

尾盘罕见,不到400万元,301418拉升逾16%

数据宝
2026-06-03 15:33:46
最多3年2.07亿!这是步行者给西亚卡姆的全部,能否续约已有答案

最多3年2.07亿!这是步行者给西亚卡姆的全部,能否续约已有答案

奕辰说球
2026-06-03 09:44:45
知名演员无戏可拍,和母亲街边卖鱼意外走红,今选择拍视频当网红

知名演员无戏可拍,和母亲街边卖鱼意外走红,今选择拍视频当网红

白面书誏
2026-05-27 20:46:32
不能二次加热的6种食物!医生提醒:吃不完或倒掉,别乱节俭

不能二次加热的6种食物!医生提醒:吃不完或倒掉,别乱节俭

冷眼看世界728
2026-05-12 20:46:26
海藻为什么是男人眼中的极品

海藻为什么是男人眼中的极品

乡野小珥
2026-06-01 18:15:36
再见,杨瀚森,8换1或去雄鹿

再见,杨瀚森,8换1或去雄鹿

体育新角度
2026-06-02 19:59:18
16名国脚?曼城自己都嫌不够,19人出征世界杯创英超纪录!

16名国脚?曼城自己都嫌不够,19人出征世界杯创英超纪录!

茅塞盾开本尊
2026-06-03 15:04:05
鸟巢撒糖不到24小时!张柏芝突然官宣两大喜讯,网友:不对劲!

鸟巢撒糖不到24小时!张柏芝突然官宣两大喜讯,网友:不对劲!

林轻吟
2026-06-02 22:43:18
生育大局已定:不出意外的话,26年起中国人口将迎来3大明显变化

生育大局已定:不出意外的话,26年起中国人口将迎来3大明显变化

阿凫爱吐槽
2026-05-23 04:14:26
NBA史上最具含金量的10个FMVP:乔丹两次上榜,11年诺天王第三!

NBA史上最具含金量的10个FMVP:乔丹两次上榜,11年诺天王第三!

钱说体育
2026-06-03 10:01:55
学医后才明白,稳定血糖最好的运动,不是快走慢跑,而是这个

学医后才明白,稳定血糖最好的运动,不是快走慢跑,而是这个

健康科普365
2026-06-02 19:45:05
单位里有一个很奇怪的现象:你跟一个领导 3 年以上,不管你态度多好,多忠诚,一旦他状态不好,你就很容易成为他的“眼中钉”

单位里有一个很奇怪的现象:你跟一个领导 3 年以上,不管你态度多好,多忠诚,一旦他状态不好,你就很容易成为他的“眼中钉”

互联网思维
2026-05-29 23:35:13
4名顾客吃火锅写5000字差评:称食材腥,不愿买单,现场画面扒出

4名顾客吃火锅写5000字差评:称食材腥,不愿买单,现场画面扒出

李晚书
2026-06-01 10:53:54
抢七出局!交易重来!雷霆大豪赌!三大球星选谁?

抢七出局!交易重来!雷霆大豪赌!三大球星选谁?

篮球盛世
2026-06-03 15:18:38
属猴人:后半生最大的靠山,不是子女,不是财运,而是这2个人

属猴人:后半生最大的靠山,不是子女,不是财运,而是这2个人

阿龙美食记
2026-05-29 22:02:25
王皓底牌大揭秘:暴揍张本智和前,梁靖崑被叫进房间问了三个问题

王皓底牌大揭秘:暴揍张本智和前,梁靖崑被叫进房间问了三个问题

不似少年游
2026-06-03 14:56:50
5月销量一公布,有些新能源车真的危险了!

5月销量一公布,有些新能源车真的危险了!

西莫的艺术宫殿
2026-06-03 00:31:19
2026-06-03 16:39:00
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
11961文章数 117090关注度
往期回顾 全部

科技要闻

传DeepSeek融资意向500亿:腾讯投100亿

头条要闻

94版《三国演义》成观众心中"白月光" 多位扮演者离世

头条要闻

94版《三国演义》成观众心中"白月光" 多位扮演者离世

体育要闻

选择中国品牌的库里,和他们的巨大野心

娱乐要闻

官方痛批乱象 刘涛郑恺等艺人遭点名

财经要闻

AI,开始偷懒了?

汽车要闻

依托全域辅助驾驶布局 千里浩瀚助推吉利5月市场大热

态度原创

本地
艺术
家居
数码
公开课

本地新闻

用杨柳青年画的方式,打开天津

艺术要闻

二十年前割麦的场景

家居要闻

江畔轻奢 观云大宅

数码要闻

告别充电线 闪极直插口充电宝上市 一机搞定苹果安卓

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版