智猩猩AI整理
编辑:金水
语言模型智能体早已从"写代码、跑实验"一路卷到了"造 AI"本身。
但当 AI 开始参与下一代模型的研发,一个靠跑分答不了的问题浮出水面:真实项目里,到底谁来判断"什么值得做"、谁在方案里拍板、谁在结果不确定时决定下一步往哪走?
面对这个痛点,上海AI实验室联合复旦大学提出了 Atria Dawn Preview,一个面向科研与工程工作流的基础级智能体语言模型,发布第二天就登上 Hugging Face 日榜第二。
![]()
建立在 7440 亿参数(744B)混合专家(MoE)基座之上,靠一条"可验证经验管线"把每次工具交互接进真实执行环境,用外部可核查的结果给经验背书。
在覆盖科研、工程、网安等领域的 16 个基准中,模型于5 项取得已公开报告的最高分;而在其自身研发过程里,约三分之一的 AI 辅助任务被参与者判定为"无 AI 则不可行"。
![]()
论文题目:
Atria Dawn: The Dawn of Agentic Superintelligence On the Evolving Roles of Human–AI Collaboration
01
可验证经验管线
Atria Dawn 的训练核心是一条贯穿始终的可验证经验管线(Verifiable Experience Pipeline),其目标是将智能体与环境交互产生的经验轨迹,转化为可复用于下游任务的能力。该机制由五个相互衔接的环节构成。
1. 任务与真实执行环境绑定
每一训练任务均接入真实执行环境,模型观察环境状态、调用工具、生成中间产物(artifacts),并依反馈调整动作。学习发生于具身交互过程之中,而非离线推理。
2. 外部信号验证
每次行动的结局须由外部信号核验,包括可执行测试、量化指标、文件状态、几何结构、溯源证据或人工判据。仅当一条经验完整串联"任务—轨迹—产物—验证证据"四要素时,方被纳入模型的可复用能力库。
3. Rollout 内循环
单次 rollout 中,智能体持续执行"观察环境—选择工具—检视输出—依反馈修订"的循环,并借助领域相关的验证信号(测试、指标、状态、几何与溯源)进行校准。该过程习得的是状态感知、反馈解读与错误恢复等通用研究行为。
4. 轨迹策展
对经验轨迹进行筛选,剔除不完整、自相矛盾、重复及行为无效(behaviorally invalid)的样本,仅保留任务、轨迹、产物与验证证据之间的有效关联,以避免噪声与错误范式进入训练。
5. 失败诊断驱动构造
频繁出现的失败模式(工具选择失当、验证不充分、证据缺失、恢复失败等)被用于生成新的训练任务与质量检查;结果经独立确认的失败运行可反作诊断样本。针对长程工作流,记录涵盖任务发起、日志与产物检视及执行计划修订,用以训练长链自查与恢复能力。
上述环节共同将非结构化的试错经验规约为可验证、可吸收的训练信号,构成本文后续工程实践的方法基础。
02
工程落地:
人机研发分工的量化实验
Atria Dawn 的研发过程本身即构成该智能体的实证场景。论文基于 56 名参与者、769 条任务记录与智能体日志的量化分析,考察人与智能体在真实研发中的职责分配。
![]()
1. 人机角色的演进
研究团队将人机关系划分为三阶段:模型初为被研究的"客体",实验由人全包;继而成为"任务级执行者",承担模块化实现、实验运行与日志分析,但工作流、评测标准与任务拆解仍由人主导;当前则演进为"项目级同事",在既定目标与评测标准内自主规划、执行并依反馈迭代。
人的职责随之上移至关键节点的高层判断与定点干预。
2. 使用强度与决策权属
739 条有明确反馈的任务中,713 条(96.5%)使用了 AI;8 月 7 日至 9 月 4 日间,单人类 prompt 对应的智能体动作数日中位数由 11.0 升至 28.5。
![]()
决策归属方面,"方法/参数"决策以"AI 提议、人类选定"为主(55.4%),但最终决定权由人类掌握 85.5%(目标/范围 93.4%,验收标准 81.9%),AI 自主决定的仅占 6.1%–9.2%。
![]()
AI 在"提议"环节的占比随决策类型由 16.9%(目标/范围)升至 55.4%(方法/参数),而最终决策权始终稳定于低位,说明变化主要发生在方案生成,而非方向裁定。
3. 故障恢复与人工介入
588 条记录到困难的任务中,76.0% 经人类介入得以推进,23.0% 由智能体自主恢复,仅 1.0% 未解决。
![]()
人类介入以信息供给为主,补充上下文/澄清需求(35.2%)、诊断问题/调整方法(34.7%),直接改写(3.2%)或接管(0.7%)极少,即人类修正"智能体所知"的频率约为修正"由谁执行"的 18 倍。
工程上团队广泛采用 yolo(Codex)与 skip-permissions(Claude Code)等放权模式以维持长任务连续运行,但研究团队指出该权责边界多出于便利考量,而非经系统性设计,这正是后续开放挑战所针对的议题。
03
性能评估
1.总体评测结果
16 个基准覆盖工具调用、搜索与研究、工作区生产力、专业任务、软件工程、终端、ML 工程与网络安全八类。Atria Dawn Preview 在 5 个基准上取得已公开报告的最高分:
![]()
此外,在 SkillsBench(66.4)、Workspace-Bench(65.0)、Workspace-Bench-Lite(68.2)三个基准上以 0.3–1.9 分的微小差距位列第二,优势分布于工具调用、深度搜索与工作区执行等多个维度,而非集中于单一能力。
![]()
在 Agentic Coding 组(SWE-bench Pro、Terminal-Bench 2.1、MLE-bench Lite、CyberGym)中,Atria Dawn 兼具前沿工程能力与安全优势:CyberGym 居首,MLE-bench Lite 以 86.2 的 HumanRank 位列第一梯队,SWE-bench Pro(59.6)与 Terminal-Bench 2.1(78.3)则与 DeepSeek V4 Pro、GLM 5.3 等处于同一前沿水平。
2. 能力演示:三个真实任务
论文给出三例端到端任务,直观展示上述能力如何落地:
1 分钟预测全球天气。在禁用网络搜索的条件下,Atria Dawn 处理超 100GB 气象数据,训练参数量超 4 亿的视觉 Transformer(ViT)网络,经 45,000 步建模 69 个气象变量的演化,生成可预测未来一周全球天气的预报系统(发布演示中 1 分钟给出预报)。
20 分钟手搓 MiniOS。从空工作区出发,约 20 分钟内构建出含串行 shell、磁盘访问、持久文件系统与解释器的可运行 MiniOS,并在两次 QEMU 会话间验证状态持久与开机自启。
隔离靶场打通漏洞闭环。在授权隔离环境中,将安全工程任务贯穿"诊断—修复—复验",完成漏洞的发现、利用、修复与复验。
04
超级智能的黎明,
需要人类守住判断权
将模型能力与研发过程并置,Atria Dawn 的实践提供两个视角:一侧是后训练所得模型能完成哪些任务,另一侧是此次后训练中人与 AI 各承担了什么。
人机协作的三阶段。论文将关系演进分为:模型初为被研究的"客体";继而成为"任务级执行者",承担模块化实现与实验运行;当前演进为"项目级同事",在既定目标内自主规划、执行并迭代。人的职责上移至关键节点的高层判断与定点干预。
但距真正的递归自我改进(RSI)仍有距离,论文提出四项开放挑战:
1.方向多样性:AI 提案多处于人类已定方向内的变体(目标层仅 16.9%),开辟新赛道的能力有限;
2.经验内化:AI 从失败习得的内容常停留于当次会话,未内化为能力,或需测试时训练等方法;
3.人类监督的有效性:当专家难以遍览 AI 工作链的终点,人类如何保持有意义的目标设定与监督,而非退化为只作确认的审阅者;
4.权责与对齐:当研究者为便利将 agent 置于完全自主模式(如跳过权限确认),权限边界由谁负责?能力每提升一步,皆须配等比例的对齐与监督投入。
回到开篇之问当智能体开始参与"造 AI",人机协作行至何处?Atria Dawn 给出的画面是我们距真正的递归自我改进仍有距离,却已站在"项目级同事"的起点。
实质性进展须同时推进"发现的能力"与"有意义的人类监督的能力";超级智能的黎明若要到来,前提是人类始终握有"什么值得做、风险由谁担"的裁量权。而那条曲线——人均每条 prompt 触发的 agent 操作数,四周内自 11 升至 28.5,其终点何在,或许才是接下来最值得追问的问题。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.