![]()
AutoDesign:
让 Harness 学会自我进化
未来多智能体系统的发展,需要模型参数与 Harness 协同进化,不能忽略任何一端。
![]()
AutoDesign For AutoDesign 示例:通过自进化迭代的最终 DesignHarness,在 40 分钟内为本论文生产了海报。整个过程调用了 253 次工具,进行了 11 轮编辑循环,最终在 3 美元的成本内完成了海报设计。
多模态输入输出任务需要一个能够长程运行的 Agent System:以 Coding 作为基础行动能力,结合工具调用、视觉感知与反馈、环境交互,以及持续的自我修改和迭代,逐步达到人类专家处理真实复杂任务的水平。在这个系统中,模型参数提供思考、推理与行动的基础能力;Harness 则负责组织流程、约束行为,让模型能够更高效、更准确地完成长程任务。
当前,模型训练已经形成了较成熟的工业化 Pipeline:通过大规模数据学习参数,再借助后训练和强化学习约束行为。相比之下,Harness 的迭代优化仍有许多问题尚未研究清楚:每次迭代应该修改哪些模块和组件?改动范围应该多大?接受一次更新的机制和标准是什么?Evaluator 应该如何设计?面对主观任务,又该使用什么指标?出现性能回退时如何定位和处理?如何提出新的方案,并保证系统沿着正确方向持续演进?
AutoDesign 选择多模态设计这一长程复杂任务,研究 Harness 的自进化问题。
![]()
- 技术报告标题:AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
- 项目主页:https://autodesign.designanything.ai/
- 代码仓库:https://github.com/Yaxin9Luo/AutoDesign
- 技术报告:https://arxiv.org/abs/2608.13560
- Demo:https://designanything.ai/
由于开源社区此前缺少一套整合多种指标和跨学科标准的海报 Benchmark,我们同时构建了 PosterBench 及完整的 Evaluation Protocol,从七个维度评价生成结果:事实来源真实性、内容覆盖度、信息密度、视觉质量、版式正确性、整体可读性和美学表现。
这套评价体系采用 Hybrid Evaluation:主观质量由 VLM Judge 评估,版面越界、文字重叠、元素比例等可以明确计算的问题,则由 Rule-based Python 算法检测。PosterBench 包含 100 篇论文,并提供由 10 篇论文组成的 PosterBench-mini,方便快速测试和比较。
除 Design Agent 主赛道外,我们还开源了固定 DesignHarness 的 CodingHarness 赛道,并通过不同子赛道控制变量,分别评价 CodingHarness、模型本身以及 DesignHarness 的质量。
基于我们提出的 MetaHarness Optimization 方法,AutoDesign 在 Paper-to-Poster 任务中的得分随着自迭代持续提升:49 → 53.2 → 68.8 → 69.7 → 73.5 → 76.3 → 78.6 → 80.9
多种模型接入 DesignHarness 后,平均提升 12.4 分;在相同 Agent 和模型配置下,AutoDesign 比 Claude Design 高 7.45 分。在一次完整的海报设计中,Agent 共调用 253 次工具,进行了 11 轮编辑循环,并将总成本控制在 3 美元以内。也进一步证明了自进化得到的 DesignHarness 是可泛化到不同模型不同的 Coding Harness 上的。
![]()
AutoDesign 通过自主优化与人工引导持续进化 DesignHarness,使各类 Coding Agent 提升 5.0–19.6 分,最高达到 81.5 分。
AutoDesign 方法论细节
AutoDesign 将模型周围的 DesignHarness 作为持续学习和优化的对象。DesignHarness 由五类组件构成:上下文与记忆、工具与规范、执行运行时、任务编排,以及评估与反馈。它们共同决定系统如何读取多模态来源、调用工具、生成作品、发现问题并完成交付。
![]()
AutoDesign 通过嵌套的内外循环实现自进化。在内循环中,Designer 根据来源上下文调用工具,生成可编辑的 HTML,并结合渲染结果、规则验证和 VLM Critic 的反馈进行局部修订。
在外循环中,MetaHarnessOptimizer 汇总多个任务中的 Rollout 轨迹、工具调用、渲染诊断和 Evaluator 反馈,识别反复出现的失败模式。随后,Optimizer Code Agent 针对一个明确的 Harness 组件提出有边界的代码更新。为了保证收益可以归因,每次外循环只允许修改一个组件;候选更新只有在提升训练任务表现,且不导致独立 Development Set 退化时,才会被接受并写入下一版 DesignHarness。
“一次只修改一个组件” 和 “使用独立开发集” 是我们从大量实验中总结出的两个重要原则。前者避免多个改动同时发生,导致 Credit Assignment 混乱;后者防止系统只记住训练任务。二者共同保证每次被接受的更新都能沉淀为可审计、可复用的设计经验,而不是一次性的 Prompt 调整。
因此,最终得到的 DesignHarness 不是一组固定 Prompt,而是一套可复用的设计生产系统。它能够构建来源上下文、协调工具调用、生成并检查可编辑输出,同时保留可追溯的执行证据,支持后续修订和下一轮系统演化。
![]()
Design Harness 利用 Critic 反馈迭代生成和修改作品,构成内循环;外循环则通过在设计任务中运行该 Harness、评估输出、提出单个组件的更新,并决定接受或拒绝候选更新,持续优化 Design Harness。整个过程可自主运行,也可选择性地加入人工指导。
为什么选择 “论文到学术海报” 作为验证场景?
我们将 Paper-to-Poster 作为主要验证任务。与侧重风格和视觉氛围的商业海报不同,学术海报需要把长篇、多模态论文压缩成单页传播媒介,同时保证事实可追溯、核心结果完整、图表和数值准确,版式可读且内容可编辑。一张海报即使视觉精致,只要写错数值或遗漏核心贡献,就无法承担科学传播的功能。因此,Paper-to-Poster 是检验设计智能体能否完成长程设计、检查和修订的严格场景。
好不好,不能只靠 “看起来不错”
为了使用统一、独立的标准评估优化后的系统,我们发布了 PosterBench。主赛道覆盖五个学科的 100 篇论文,PosterBench-mini 则提供由 10 篇论文组成的低成本测试集。评测从七个维度衡量生成结果:事实忠实性、内容覆盖度、信息密度、视觉证据、布局、可读性和美学表现。
PosterBench 采用规则算法与 Rubric-based VLM Judge 相结合的评测方式。规则算法负责检查文本溢出、元素重叠、空间利用率和数值一致性等可程序化问题;VLM Judge 则结合论文来源,评价视觉表达和科学传播质量。此外,我们还通过系统盲测的人类评审,检验自动评价与人类偏好的一致性。
PosterBench 是一套在优化完成后使用的冻结评测协议,并不直接作为驱动内外循环更新的打分器。这一隔离可以降低系统针对最终评测过拟合的风险。
![]()
Benchmark 的规则驱动评测算法可视化,以及它们分别监测了哪些部分、具体是如何监测的。
AutoDesign 还提供了可本地部署的客户端。Agent 生成内容后,系统会将结果加载到可视化画布中,用户可以通过三种方式继续编辑,编辑完成后,系统支持导出 PPTX、PDF 等格式。
- 与 Coding Agent 进行多轮对话,实时修改内容;
- 选中并圈出需要调整的区域,以多个 Comment 的形式向 Agent 提出修改要求;
- 使用传统设计软件中的手动编辑功能,调整颜色、配色、字体和间距,或者插入、删除图片。
![]()
视频链接:https://mp.weixin.qq.com/s/M6Xx93srjC-ROIoE5vI9Eg
在 PosterBench Main Track 的相同 Claude Code + Claude 4.8 设置下,AutoDesign 获得 78.32 分,超过闭源商业系统 Claude Design 7.45 分。将学习得到的 DesignHarness 接入七组控制变量实验的 Coding Agents 后,平均分从 54.99 提升至 67.39,平均提高 12.4 分。而我们还人类评测做了系统盲测人评:收集了 933 个有效判断,AutoDesign 的 Bradley–Terry(离线版本的 ELO 测试,跟各种 Arena 方式一样)AutoDesign 的胜率估计为 64.0%,同样在受评系统中居首。
![]()
未来展望:从一张海报开始,
但不止于海报
AutoDesign 作为我们研究路线的第一个项目,未来,我们会从海报继续扩展到 PPT、网页和学术演讲视频等多模态内容。当前系统已经能够一键将论文转化为这四种传播媒介,但方法论和效果仍有优化空间。
更长期的问题是:能否让一个 multimodal-in、multimodal-out 的 Agent System,将人类偏好和任务经验持续积累为系统级能力,并实现 Recursive Self-Improvement?我们的下一个项目将继续探索这一方向,希望构建一个能够持续自我进化的系统,同时避免类似 Reward Hacking 的评测投机,并将这种能力泛化到不同的生产级任务中。
![]()
欢迎体验代码,提 issues,PRs,一起参与这套系统下一阶段的共建。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.