来源:市场资讯
(来源:机器之心)
目前,各种生成模型已经越来越强;但一旦任务从「一次出图」变成持续数小时、跨越多种媒介的完整项目,真正的瓶颈往往不再是模型会不会生成,而是它能否记住项目、理解素材之间的关系、沿着用户已经确认的方向继续工作,并在出错时只修该修的部分。
JarvisHub 给出的答案,是把可编辑画布同时变成用户工作区、Agent 的外部记忆、行动空间和共享项目状态。Agent 不再只从聊天记录里猜测上下文,而是直接「看」到画布上的提示词、参考图、候选版本、生成结果、依赖关系、失败记录和用户反馈,再据此规划、调用工具、写回结果。
一句话概括:JarvisHub 不是又一个单点生成工具,而是一套面向长程多模态创作的开源 Agent 运行底座。
![]()
项目主页:https://www.jarvishub.site/
GitHub:https://github.com/LYL1015/JarvisHub
论文全文:JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
作者团队:JarvisX Team;核心贡献者 Yunlong Lin、Zixu Lin、Zhaohu Xing;学术顾问 Tianyu Pang、Xiangyu Yue。
一、研究背景与动机
模型生成能力虽强,但是项目状态容易丢
真实创作很少是一条「输入提示词——得到成品」的直线。创作者通常要先收集参考、确定风格或角色、规划页面与镜头,再生成多个候选、比较版本、局部修改、吸收反馈,最后把散落的中间结果组装成交付物。提示词、草稿、失败尝试、版本分支和反馈并不是边角料,它们共同构成项目不断演化的状态。
当前常见方案包括:
Prompt-to-Output 工具:擅长快速产出单个素材,却往往隐藏或丢弃中间决策、替代方案与修订历史;当任务拉长,前面做过什么、为什么这么做,很难被稳定继承。
聊天式创作 Agent:可以按步骤调用工具,但主要上下文仍是线性对话。空间布局、素材引用、版本分支和局部编辑目标一多,聊天记录就很难完整表达「项目现在长什么样」。
节点式工作流:步骤更透明,却通常依赖人工预先搭好固定管线。它描述的是「程序怎样运行」,未必是一个 Agent 能持续读取、扩展、修订和验证的可编辑项目状态。
商业产品已经显露出从「生成资产」转向「协助完成项目」的趋势,但闭源架构让研究者难以进一步观察:Agent 如何表示上下文、怎样选择工具、如何利用反馈、怎样修复失败,以及如何在长流程中维持一致性。JarvisHub 瞄准的,正是这个尚未被充分打开的中间层。
JarvisHub 的回答:把画布升级为 Agent 工作区
在 JarvisHub 中,画布不只是把素材摆出来看的 UI,而是人和 Agent 共用的项目对象。每张参考图、每段视频、每个网页预览、每一版幻灯片都可以拥有稳定地址,并通过「引用」「版本沿袭」「生成依赖」「分组」或「工作流延续」等关系连接起来。用户选择了哪个版本、否决了什么、某个结果由哪些素材产生,也都能留在同一张画布上。
![]()
图 1:JarvisHub 与 Prompt-to-Output、聊天式 Agent、节点式工作流的比较。核心差异在于统一且可持续更新的项目状态。
二、技术核心亮点
1. 画布原生项目状态:把创作过程变成可编辑图谱
JarvisHub 将项目表示为一张「有类型的多模态资产图」。节点既保存图片、视频、音频、UI、文本等内容,也携带位置、可编辑输入、生成输出、来源信息、执行诊断和运行状态;节点之间的边则描述参考关系、版本关系、生成依赖、分组关系或流程延续。
可寻址:Agent 可以明确指向「第三版网页预览」或「已被用户选中的第二个镜头」,不必依赖模糊的对话指代。
可复用:参考素材、草稿、被否决的候选或中间结果,都能在后续生成与编辑步骤中再次成为输入。
可检查:用户和 Agent 可以追溯某个结果受到哪些材料影响、沿用了哪个版本,以及哪些下游内容会受一次修改波及。
2. 三层核心架构:状态、协议与运行时各司其职
JarvisHub 的核心由三层组成:Canvas State 保存素材、版本、依赖与用户选择;Protocol Bridge 负责权限、能力清单、动作校验和写入控制;Agent Runtime 负责观察画布、规划动作、编排工具,并把可验证的结果重新合并进画布。
其下方的轨迹记录、评估器、人类编辑与检查点,则为反馈、恢复和后续分析提供证据。
![]()
图 2:JarvisHub 核心架构。画布状态、协议桥与 Agent 运行时共同构成可检查、可控制、可恢复的创作循环。
3. 协议约束的画布操作:Agent 不能「想改哪就改哪」
长流程创作要可靠,关键不只是让 Agent 会调用更多工具,还要让每次修改显式、合法并可恢复。JarvisHub 为每一轮提供 Capability Manifest,列出当前可用的节点类型、变更操作、工具与资产句柄,限定本轮允许执行的动作。只有能被编码为受检工具调用、画布变更、评估请求、澄清请求或用户回复的行为,才会真正落到项目里。
这意味着,画布变化不再隐藏在模型内部:Agent 新建了什么、更新了什么、调用了哪个工具、得到什么观察、为何进入下一步,都能通过协议桥写入轨迹。权限与状态边界也因此更加清楚。
4. 反馈驱动的局部修复:从「重做一遍」变成「只修坏掉的节点」
反馈可以来自用户与评估子 Agent。用户可以选择候选、否决版本、修改提示词、调整风格或指出局部缺陷;系统完成创作时,也可以调用子 Agent 检查一致性、缺失证据、视觉质量与任务约束。
反馈的作用不是给中间结果简单打分,而是决定下一次状态转移:沿用已接受节点继续、局部修复失败节点、向用户澄清,或在证据不足时停止。
三、方法详解
1. 一轮交互如何发生:观察——行动——验证——回写
每一轮从用户请求开始。运行时先读取共享画布,理解当前素材、依赖、版本和状态;随后在能力清单与执行授权范围内选择动作,调用相应能力并获得工具观察;协议桥验证后,将结果、状态与证据写回画布;用户再在同一画布中检查、选择、编辑或反馈,进入下一轮。
![]()
图 3:Agent 运行时循环。每次能力调用都经过协议检查,并以可观察结果回到共享画布。
2. 五类工具覆盖创作与恢复
Canvas Tools:读取、创建、更新、连接、分组、选择和分支节点,并维护资产句柄与运行状态。
Generation Tools:负责图像、视频、音频和组合媒体生成。
Native Tools:连接浏览器、文件、代码、搜索、文档和演示文稿等外部执行环境,并返回可检查的产物。
Recovery Tools:提供结构化反馈、验证、检查点和局部修复。
MCP Tools:让外部服务在同一套 Manifest 与 Grant 约束下接入。
3. Skills、Memory 与 Subagents:为长任务组织能力
工具决定「能做什么」,Skills、Memory 和 Subagents 则帮助运行时决定「怎样把事情做完」。
Skills 封装故事板、参考图引导生成、设计还原网页、视频提示词或演示文稿构建等可复用流程;Memory 保留用户偏好、既有选择与跨轮次知识;Subagents 在工作流可分支时并行处理相对独立的子任务,再由主 Agent 选择结果并合并回项目图。
4. 轨迹清晰可见
JarvisHub 记录的不只是最终作品,还包括每轮用户请求、执行前画布、可用能力、授权范围、选定动作、工具观察、反馈、修复决策与更新后的画布。
由此,研究者可以看到 Agent 是否忽略参考、丢失用户已经接受的选择、覆盖有用版本,或在本应局部修复时错误地进行全局重生成。
对开放式创作任务而言,这一点尤其重要:多个最终结果都可能「看起来不错」,但过程可能脆弱、不可复现;反过来,一个暂时不完美的结果也可能保留高价值的中间素材和可恢复决策。评价对象因此从单个成品扩展为整条创作轨迹。
四、实验与案例
1. 叙事媒体生成:跨镜头保住角色、场景和动作连续性
系统接到「制作一部关于牛仔机器人僵尸拾荒者的短剧」后,在画布中外化任务简报、故事规划、视觉参考、镜头候选、依赖关系和生成进度。
最终关键帧保持了反复出现的机器人牛仔、海边场景与叙事动作线索,展示了长流程中角色身份、风格与跨镜头连续性的管理方式。
![]()
图 4—5:叙事媒体案例的画布工作轨迹与最终关键帧。上方为可检查的项目过程,下方为生成结果。
2. 交互式网页开发:把设计方向、代码实现和预览修订放在一起
网页任务要求创建一个轻盈、Awwwards 风格、带丰富动画的个人摄影网站。画布同时跟踪设计参考、布局草案、实现产物、页面预览与修订状态,让 Agent 不必在「视觉方向」和「代码进度」之间反复丢失上下文。
最终页面在排版、图片摆放、页面结构和整体视觉方向上保持一致。
![]()
图 6—7:交互式网页开发案例。画布记录设计与实现轨迹,并输出风格一致的摄影网站页面。
3. 演示文稿生成:同时维持知识结构与跨页视觉体系
第三个任务是制作一份「斯坦福课程风格」的机器学习决策树 PPT。画布记录课程内容、生成图示、幻灯片草稿、依赖关系、PowerPoint 预览和修改进度。
最终结果在主题组织、图示风格、强调色与跨页布局上保持一致,说明系统能够把内容筛选、叙事编排、视觉合成和页面级检查串成长流程。
![]()
图 8—9:演示文稿生成案例。上方为画布中的内容与页面编排过程,下方为最终幻灯片样例。
三个案例共同验证了什么?
JarvisHub 验证的是:开放目标可以被拆成可观察的项目状态,参考与候选可以被持续复用,工具执行能返回可检查证据,用户反馈能决定下一次局部更新,而最终作品与生产过程可以同时保留下来。
五、研究价值与现实边界
从「评成品」走向「评过程」
开放 Harness 为未来创作 Agent 研究提供了三条更具体的路径。
第一,可以构建 Project-State Benchmark:任务不只给一个提示词和目标答案,还提供初始画布、参考材料、可用工具、约束、反馈事件和预期检查点。
第二,可以把最终质量与过程指标结合起来,评估上下文保持、工具选择、依赖正确性、反馈遵循与修复成功率。
第三,每次运行都能沉淀结构化的状态、动作、观察、反馈与修复数据,为训练后续 Agent 形成数据飞轮。
六、结语与展望
生成式 AI 的下一阶段,是能否在一个不断变化的项目中持续工作:理解现有状态、接住用户选择、调度合适工具、保留过程证据,并在错误发生后恢复。JarvisHub 把这一问题落到一张人和 Agent 都能读写的画布上。
当提示词、参考、候选、版本、依赖、反馈和检查点都成为可寻址的项目对象,创作 Agent 才真正有机会从「一次性生成器」走向可协作、可观察、可纠偏的长期创作伙伴。
对于研究者而言,它也提供了一个开放入口:不只研究最终作品好不好,更研究 Agent 是如何一步步把作品做出来的。
从聊天框到共享画布,从单次调用到长程协作——JarvisHub 试图搭起的,正是多模态创作 Agent 走向真实生产所缺少的那层运行基础设施。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.