一个研究团队把自己做模型的全过程摊开数了一遍:96.5%的任务里用上了AI智能体。但同一批数据里,关于方法和参数的决策,人类拿走了85.5%,AI只占9.2%。
这项研究来自复旦大学参与的一个团队,研究对象是他们自己开发的一个智能体语言模型,叫 Atria Dawn Preview。团队分析了700多条任务日志,来自56名参与者,外加他们所用智能体的日志。
![]()
Atria Dawn Preview 基于混合专家架构,参数量7440亿,面向研究和工程任务。它的训练流程把每个任务绑到一个真实执行环境上:调用工具、生成中间结果,再用测试、指标或来源证据这类外部信号去校验。团队称它在16项基准中的5项领先,包括网络搜索和网络安全,但整体上并没有压过竞争对手。
智能体动作变多,不等于它更自主
项目推进过程中,参与者把越来越多的事交了出去。智能体动作与人类输入的比值中位数,四周内从11涨到了28.5。
团队特意提醒,别把这个数字读成自主性在增长。每一个由人做出的决定,会引出更多智能体步骤,这不代表智能体自己在做更多决定。
参与者还被问了一个问题:如果没有AI,你能不能以同样的范围和同样的质量完成自己那部分任务?在455个完成的AI辅助任务里,有151个被评为"没有AI就做不了",大约三分之一。这些任务分布在56名参与者中的27人身上,不是少数重度用户撑起来的数字。在这些情况下,AI不是把已有的活干快了,而是让那些本来根本不会启动的工作变得可能。
AI提方案,人来选
在方法和参数上,最常见的模式是"AI提议、人类选择",占55.4%。整体看,人类做了85.5%的方法与参数决策,AI只有9.2%。目标和范围上,人类在93.4%的情况下做了最终决定。
AI在提议环节的占比随决策类型浮动,从17%到55%不等;到了最终决定环节,它的占比一直停留在个位数。谁提出选项差别很大,但最终拍板的绝大多数时候是人。即便在那151个"没有AI就做不了"的任务里,人类也有95.4%的时候在选目标。
出问题的时候,同样的模式又出现了一遍。在588个记录了难点的任务中,76%靠人类介入才往前走,23%由智能体自己解决。人类的帮助几乎都是给信息:要么补充上下文、澄清需求(35.2%),要么诊断问题、切换方法(34.7%)。人很少亲自动手干活——部分修改占3.2%,完全接管只有0.7%。
AI的输出需要返工时,在收到人类反馈后,75.4%的修改由AI自己完成。卡住流程的是人的判断,不是人的执行。
从研究对象,到项目伙伴
团队把AI的角色分成三个阶段:先是研究的对象,然后是个体任务的工具,现在是项目伙伴。在当下这个角色里,AI在人类设定的目标内起草和调整计划。他们还提了一个推测性的第四阶段:递归自我改进,更强的模型产出更强的后继者。
作者们说,一个模型可以在训练任务上越做越好,却不一定在"开发自己的后继者"这件事上变得更强。AI如何提出多样的研究方向、并在结果出来之前评估它们的价值,仍是一个开放问题。
当每个决定都压在一串比任何人都长的智能体工作链上,监督就变难了。团队写道,最坏的情况下,人类会变成只能对自己看到的东西盖章的审核者。不少参与者还让智能体跑在自主模式下,以免用不断的审批打断长任务。这条边界是图方便画出来的,不是经过深思熟虑后决定该给AI多大权限。
这篇论文正好落在关于递归自我改进的争论中间。Anthropic认为,一个能开发自己后继者的AI可能比预期更早出现,CEO Dario Amodei 因此呼吁给行业设一个速度上限。据Anthropic的说法,公司内部关于研究方向的决策,人类现在只占个位数百分比。OpenAI在整个开发周期里使用 GPT-5.6 Sol;谷歌和DeepMind则通过记录搜索轨迹的 Dream-RSI 让AI智能体探索替代策略,不过它们改进的只是搜索策略,不是模型本身。
近期有超过一千名来自领先AI公司的员工警告,他们所在的组织可能正处在自动化AI研究的边缘。普林斯顿和英国AI安全研究所的另一项研究得出了与 Atria 团队更接近的结论:前沿模型能处理研究工程,但在真正要紧的判断上会失手。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.