![]()
一刻 talks | 硬科技·新商业
265次代码提交,127个合并请求,151个议题。
一个从空文件夹里长出来的完整软件项目,16天,没有人碰过键盘。
这不是科幻小说,这是阿里8月3日发布的Qwen3.8-Max在内部测试中真实跑出来的成绩。它被要求"创建一个自进化的智能体框架",然后它自己建了工程循环、自己认领任务、自己写代码、自己跑测试、自己修bug、自己合并Pull Request。
全程不需要人类,不是不需要人类写代码,是不需要人类管理它。
![]()
这可能是2026年迄今为止,AI领域最被低估的一条新闻,因为大多数人看到"2.4万亿参数"的时候,以为这又是一篇跑分通稿,它不是。
这对你意味着什么? 如果你写代码,一个模型现在能自己接管你整个项目,不是帮你写一个函数,是从空文件夹开始,连续16天不停手,自己设计架构、自己测试、自己上线。 它不需要你审代码,它自己会审自己的代码。 如果你管理团队,你手下最好的工程师请了两周假,回来发现一个AI已经替他把活干完了,265次commit,没有一个是他写的。 他在团队里的角色是什么?审AI的代码,还是被AI取代? 如果你不写代码,Qwen3.8-Max的成本是每百万token输入2美元(海外定价)。翻译一下:让一个AI帮你干一整天的复杂工程,成本可能比你点一顿外卖还便宜。 这不是"AI能干什么"的问题,这是"人还需要干什么"的问题。
我们不猜AI会不会取代程序员,我们帮你看清楚一件事:
当机器能自己管理自己连续工作16天不停手、不出错、还不断自进化,人的角色就不再是"操作者"了。人变成了"定义问题的人",你能不能问出对的问题,决定了你还有没有用。
![]()
16天,从空文件夹到127个PR
到底发生了什么
先说那个最惊悚的案例。
阿里给了Qwen3.8-Max一个任务:创建一个叫oh-my-cli的自进化智能体框架。没有代码模板,没有架构文档,就是一个空仓库,加一句"做一个能自己进化的Harness"。
然后模型干了什么?
它自己搭了一套工程循环,需求进入GitHub Issues,一个Agent通过状态机自动认领,走ready→leased→active。
![]()
Qwen3.8-Max展示了自主科研能力
写完代码自动触发端到端测试和CI检查,过了就合并主分支。每次更新还自己跑Build、单元测试、桌面生命周期校验,任何异常自动回流到对应Issue,自己修复。
而且它不是按预设流程走的,它接入了社区反馈和用户需求,把外部信号实时翻译成新的开发任务。
到7月30日,16天过去,265次commit,127个PR,151个Issue。一个真正可用的、完全开源的Agent框架,躺在GitHub的qwen-code-dev-bot/oh-my-cli仓库里,任何人都可以去查。
这不是AI辅助编程,这是一个AI工程师,独立完成了一个完整的软件交付周期,
需求→设计→开发→测试→部署→维护→迭代
它的产出比大多数初级工程师三周的产出更多、更干净。
![]()
不止会写代码
它还抢了研究员的活
代码只是其中一条线,阿里还给了它一篇论文,"Unified Data Selection for LLM Reasoning",让它复现实验,然后想办法做得更好。
不给初始代码,不给数据处理流水线,只有论文原文和GPU权限。
模型跑了125个小时,写了7600行代码,执行了1100个动作,做了33轮训练。
![]()
前37小时复现了论文的全部6个核心发现,然后它没停,它自己提假设、自己做实验、自己分析结果。18个改进想法中,一个关于"更精确计数困难决策点"的方案,把AIME24数学基准分从49.58%推到了52.29%。
这不是执行指令,这是科研,自己发现问题、自己设计实验、自己发现更好的方法。它不是在模仿人类的论文,它在改进人类的论文。
还有一个测试更直接:阿里把它丢进了WWW2025多模态对话意图识别竞赛,526支人类队伍参赛。
![]()
WWW2025多模态对话意图识别挑战赛
Qwen3.8-Max自己设计解决方案,24小时内做了45次迭代提交,准确率从0.60爬到了0.853。这个成绩超过了87%的人类对手。
![]()
技术上的三个关键信号
先看参数:2.4万亿总参数,但每次只激活950亿。稀疏MoE架构加混合注意力机制。
翻译:它很大,但它很省,推理成本和延迟比同级别稠密模型低一个量级。
第一个信号:大模型正在从"更大=更强"的暴力路线,转向"更大但更聪明地激活"的效率路线。
再看上下文:100万token。什么概念?一整部《三体》三部曲全部塞进去,它能一次性消化完。百页法务文档、整部剧集、100小时直播录像,全部扔进去,全部给你转成可以检索的知识库。
![]()
第二个信号:视觉理解不再是"看图说话",是"看了,能自己照着做出来"。
RecreationBench测试里,Qwen3.8-Max被放进一个黑盒环境,没有网络、看不到源码,纯靠跟应用交互和视觉反馈,从一个截图出发,完整重建了整个前端项目。
它能看,能理解,然后能复刻。
第三个信号:下周开源,这是Qwen-Max级别模型第一次开放权重。
这是个炸弹,此前中国开源模型的最强代表是月之暗面的Kimi K3(2.8万亿参数),现在阿里把Max级也交出来开源。这意味着开源阵营第一次拥有了能和闭源旗舰正面对打的选手,而且这个选手自带完整的工程闭环能力。
![]()
![]()
人的角色还剩什么
回到你最关心的问题。
AI写代码不是新闻了,GitHub Copilot已经做了好几年,但Copilot是"你写一行,它补一行",Qwen3.8-Max是"你说一句话,它干16天"。
这中间的差别不是"效率提高了几倍",是人的角色从一个变成了另一个。
以前,程序员是"实现者",产品经理说需求,程序员写代码。现在,程序员是"监督者",AI写代码,程序员审代码。
Qwen3.8-Max的下一步,程序员可能连"监督者"都不是了,因为它已经会自己审自己的代码了。
![]()
在 Frontend Code Arena 排行榜上名列第四
人剩下的角色只有一个:定义问题。
"做一个能自己进化的Harness",这句话是人说的,16天里模型做的所有事,都是围绕这句话展开的。
如果人不知道应该做一个什么样的Harness、不知道Harness应该解决什么问题,模型再强也没用。
AI消灭的不是"写代码的人",AI消灭的是"只会写代码的人"。
那些知道"应该建什么"的人,会变得无比强大,因为他们现在有一个永远不会累、永远不会请假、16天连续工作不出差错的工程师团队,成本是一杯咖啡的价格。
明天,我们聊聊,他被董宇辉盖了整整两年,上周末,他抛掉前CEO身份自己下场直播,首播就登顶第一。不是复仇,是裸考过了……
关注「一刻talks」
我们不贩卖焦虑,我们帮你看清楚,当机器学会了自我管理,人的价值不在执行,在方向。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.