网易首页 > 网易号 > 正文 申请入驻

GPT-6 Astra也会「看错」流程图? Einsia AI发布PPTBench

0
分享至

机器之心发布

Coding Agent 正在从屏幕里的终端世界走向屏幕外的物理世界。

过去,Agent 面对的主要是文本:给它一个任务,它通过调用工具、修改代码、运行测试,最终交付软件。整个过程,本质上都发生在字符串之间。

但如今,越来越多的任务开始将「视觉世界本身作为输入」。

一幅流程图、一张网页设计稿、一个 3D 场景草图,甚至一整页 PPT,都可以成为 Agent 需要理解并用代码重建的目标。于是,Coding Agent 正在面临一项新的考验:

「Visual Coding」—— 看懂一个视觉目标,并把它转化为可执行、可编辑的代码。

这看起来只是多了一层视觉输入,实际上却引入了一个全新的挑战:在保证代码能运行的基础上,Agent 必须还要从视觉输入中理解对象、结构、空间关系和语义,再把这些信息准确地编码进程序。

那么,如何才能既看清 Agent 在 Visual Coding 上走到了哪一步,又推动它继续向前?

一个好的测试载体,既要有足够丰富的视觉结构,又要能够被程序化地表达和编辑。

PPT 恰好满足了这两个条件。一页 PPT 不是一张简单的图片,而是由文本、形状、连接线、分组和空间布局共同组成的可编辑对象集合。它既保留了视觉世界中的结构,又给出了一个天然的程序化表达空间。视觉上的相似,并不意味着语义上的正确。 一条箭头接错节点,流程关系就变了;一个小节点被漏掉,整个过程的含义也可能随之改变。

这也正是 Einsia AI 旗下 Navers Lab 最新发布的 PPTBench 想回答的问题:

「今天的 AI Agent,能不能真正看懂视觉目标,并把它准确转化成代码?」


  • 论文题目:PPTBench: Can Coding Agents Reconstruct the Visual World through Structured, Editable Slides

  • 项目主页:https://lab.einsia.ai/pptbench

  • GitHub:https://github.com/Einsia/PPTBench

  • arXiv: https://arxiv.org/abs/2609.29718

  • AgentGit(查看部分评测Session): https://agent-git.com/@einsia/ppt-bench

当 Agent 不再只是写代码,而是要理解 “图在说什么”

PPTBench 的任务来自真实科学论文中的流程图和架构图。研究团队从中构建了 500 个任务,覆盖系统与软件、人工智能、计算机视觉、语言与语音、量子与基础物理、天文、机器人、生物医学等 13 个领域,同时包含多面板图、层级结构、重复网格、复杂连线和文字密集等不同类型的布局。


对 Agent 来说,任务非常直接:

给定一张流程图,用代码把它重建成一页 PowerPoint。

输入是一张确定的视觉目标,输出则是一份真正由代码生成的、可编辑的 PPTX。Agent 不能简单地把原图贴进幻灯片,而需要用文本、形状、连接线等原生 PowerPoint 对象,把看到的内容重新表达出来。

真正困难的地方,也恰恰藏在这里。

Agent 首先要看懂这张图:识别其中有哪些节点、文字和关系,理解连接线从哪里出发、指向哪里;然后要把看懂的内容写出来:将这些结构准确地映射到二维画布,处理节点大小、间距、文字和连线的位置;最后还要交付一个正确的程序化产物:生成的 PPTX 能够正常打开,里面的内容也必须是真正可编辑的对象。

换句话说,这不是简单地 “把一张图画出来”。

它要求 Agent 同时解决三个问题:看懂、写对、交付。

流程语义错了,图表达的就是另一个算法;几何位置错了,虽然还能看懂,却失去了原图的精确结构;产物本身出了问题,则连后续查看和编辑都无法进行。

也正因为如此,一个看似简单的 “照着图做 PPT”,实际上成为了检验 Visual Coding 能力的一道综合测试。


输入:一张流程图

输出:Agent重建成为可编辑的PPT

Agentic Judge:让 “看懂” 和 “做对” 都能被评测

一张还原出来的 PPT,可能和原图看上去几乎一模一样。但如果它本质上只是一张截图,就无法真正编辑;如果箭头方向反了,流程表达的语义也随之改变;如果出现大面积渲染错误、文字溢出或严重遮挡,整张幻灯片甚至失去了基本的可读性。

更复杂的是,PPT 中的同一个视觉元素,往往可以有完全不同的对象表达方式。

一个田字格可以由四个方块组成,也可以由一个方块和两条直线组成;一个对勾可以由两条直线拼成,也可以由一个多边形直接绘制。对于传统的规则系统来说,很难穷举这些 “一对多” 的表达方式。

PPTBench 因此设计了一套 Agentic Judge。它不要求 Agent 按照某一种固定的对象树来重建,而是从最终交付的 PPT 出发,逐层判断它是否真正完成了任务。

首先是一个 Artifact Gate,判断产物是否具备进入正式评测的资格。Judge 会检查 PPTX 能否正常解析和渲染,是否生成了单页幻灯片,是否包含足够的原生可编辑对象,以及是否存在直接贴图等不符合要求的情况。如果产物本身无效,就直接判为 0 分。


通过 Gate 后,Agentic Judge 再依次完成三个阶段的评测。

Stage 1:先判断 “做没做对”

这一阶段关注的是最核心的问题:Agent 重建出来的图,是否还在表达原来的过程。Judge 会从整体上理解参考图和生成结果,判断关键关系有没有被正确还原。只要流程本身发生了改变,即使视觉上再接近,也不能算正确。

Stage 2:再判断 “能不能看”

语义正确之后,Judge 进一步检查生成结果是否具备基本的可读性。严重的渲染问题或排版错误,可能让一张语义正确的 PPT 依然无法使用。这一阶段主要排除这类影响整体阅读的错误。

Stage 3:最后判断 “有多像”

通过前两关之后,Judge 才进入细节层面的比较。它会进一步分析整体布局和局部视觉差异,并把发现的问题结构化记录下来。这里不再要求两份 PPT 使用完全相同的对象表达方式,而是关注最终呈现出来的视觉结果是否足够接近。

总结来说,Agentic Judge 并不是简单地问 “这张 PPT 像不像原图”,而是依次回答三个问题:它做对了吗?它能看吗?它还差多少?

Agent 距离稳定复现 PPT 还有多远?

研究团队测试了 10 个模型、36 种配置,每种配置完成同一组 500 个任务。每份结果经过三轮评审,累计得到 54,000 份评审记录。

GPT-6 Astra High 以 77.34 分位居榜首。在 500 个任务中,它全部生成了有效产物,80.8% 同时通过语义和渲染检查。

其他参评模型中,Kimi K3 High 表现最好,得分为 67.80;GPT-5.6 Sol Max 和 Qwen 3.8 Max XHigh 分别得到 49.28 和 47.69 分。

Astra 的领先比较明显,但即便是这一最优配置,也仍有近两成任务没能同时通过两道检查。


这些分数背后,模型究竟在哪些环节出了问题?

视觉理解,远难于代码本身

模型还原一张 PPT 的难点,并不在于写出能被正确解析的文件;而是在于,这张文件里,到底是否表达了正确的含义。

在所有的 18000 份结果中,394 份(2.19%)未通过产物检查;随后,11526 份(占全部结果的 64.03%)因流程语义错误被拒绝。剩余 6080 份中,又有 365 份未通过渲染/文字门控,最终 5715 份(31.75%)进入细节评分。


流程图输入

Astra 6生成的结果,未通过语义门控

而在进入细节评分产物当中,文本与排版问题贡献了 53.0% 的细节扣分,局部图形占 34.3%,布局占 12.8%。失分最多的单项是文本意外换行。

这些问题又恰恰是文件代码本身无法直观体现的。一份生成 PPT 的脚本本身并不会告诉模型渲染出来的文字是否会在不应该出现的地方换行、是否会挤爆整个文本框;但在真正渲染出来的产物当中,这恰恰又是最明显的问题。


只有真正能够进行视觉审查与迭代的模型,才能够真正发现并且解决这些问题。

更多思考换来的是流程理解,而非细节重建

提高 reasoning effort,收益主要体现在更高的门控通过率。

GPT-6 Astra 从 Low 到 High,平均分由 59.42 升至 77.34,通过全部门控的比例由 63.0% 升至 80.8%,提高 17.8 个百分点;通过门控后的条件细节分仅由 94.32 升至 95.72。


但更多思考并不保证更高得分。Astra 五档的平均分依次为 Low 59.42、Medium 68.16、High 77.34、XHigh 72.60、Max 68.76。从 High 到 Max,门控通过率从 80.8% 降至 71.0%,尽管通过门控后的条件细节分升至 96.85,总分仍然下降。

这说明,思考深度带来的主要收益是让更多产物保留正确的流程,而细节精度的改善相对有限。Astra 在 High 达到最佳表现,也提醒我们:把 effort 调到最高档,或许并不是可靠的默认选择。

「回头去看」,让模型的复现变得更好

模型构建 PPT 的过程和人类并不相同。

人类会把组件一个一个拼上去;而模型则会一次写出完整的 PPTX 生成脚本,再根据视觉反馈来调整。

分析模型的调用轨迹,论文发现:对自己的产物进行视觉检查次数更多的模型,往往得分更高。


在解析了调用轨迹的 27 个配置中,模型审查轮数与得分的 Pearson 相关系数为 0.881;作为对比,修改轮数与得分的相关系数仅为 0.255。

视觉审查让模型得到最直接的反馈,让模型对下一步要做什么有直接的判断:是调整节点间距,改变箭头流向,还是修复渲染问题。

而这,正是 Visual Coding 的核心:

「当模型能够自主决定何时需要观察,能够理解自己看到了什么,并且能够做出适合的修改,视觉任务就迈向了下一个里程碑。」

PPTBench 想回答的,不只是 “谁最强”

一张科学流程图不是装饰性的海报。它同时承载了过程语义、空间关系和大量局部细节:任何一个箭头的错位或反向、节点的缺失或交换,表达的流程就完全不同。

PPTBench 的实验表明,前沿 Agent 已经能够完成相当复杂的视觉重建。但从 “能够还原” 到 “稳定地还原正确”,中间仍然存在明显的距离。 语义理解是最主要的瓶颈,而当语义基本正确之后,文字、布局和局部细节又成为新的挑战。

因此,PPTBench 想测量的并不只是模型能不能做出一张 PPT,而是一个更基础的问题:

「当 Agent 看到一个视觉目标时,它能不能真正理解其中的结构,并把这种理解可靠地写进代码?」

这也是 Visual Coding 下一阶段真正需要解决的问题。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
悬疑剧《余红旧事》首播,观众评价一针见血,好看但太短不过瘾

悬疑剧《余红旧事》首播,观众评价一针见血,好看但太短不过瘾

孤傲何妨初
2026-09-30 09:08:20
财政一旦收缩,普通人的生活最先降级

财政一旦收缩,普通人的生活最先降级

职场资深秘书
2026-09-29 17:09:39
黄金交易提醒:美联储“放鸽”油价跳水,金价绝地反击!能否重返4300?

黄金交易提醒:美联储“放鸽”油价跳水,金价绝地反击!能否重返4300?

和讯网
2026-09-30 09:18:34
理想汽车4万人抽奖,唯一中奖是罗永浩:恐怕没多少人信抽奖了

理想汽车4万人抽奖,唯一中奖是罗永浩:恐怕没多少人信抽奖了

王新喜
2026-09-29 20:02:51
悲惨!因辅导作业,情绪失控,母女相继跳楼,双双坠亡!

悲惨!因辅导作业,情绪失控,母女相继跳楼,双双坠亡!

闲侃闲侃
2026-06-25 07:43:49
郭士强宫鲁鸣只是冰山一角!新华社这盆冷水,浇醒了多少人?

郭士强宫鲁鸣只是冰山一角!新华社这盆冷水,浇醒了多少人?

刘哥谈体育
2026-09-30 03:51:47
孙宇晨“笔下”的景甜:我的掌中之物,捏着,吊着!

孙宇晨“笔下”的景甜:我的掌中之物,捏着,吊着!

默默有话说
2026-09-27 13:15:07
这就是赤裸裸的现实!工商银行已经到了最危险的时候?

这就是赤裸裸的现实!工商银行已经到了最危险的时候?

财经保探长
2026-08-23 21:43:55
太硬核!上海一面馆贴满硬核告示火了,写明“谢绝本地中年妇女点单”,还约差评网友线下单挑

太硬核!上海一面馆贴满硬核告示火了,写明“谢绝本地中年妇女点单”,还约差评网友线下单挑

王老师你还好吗
2026-09-30 12:11:42
陕西省政府发布一批任免职通知

陕西省政府发布一批任免职通知

文化艺术报
2026-09-30 11:43:09
看守所两拨人守一门,看完才懂国家真高明!

看守所两拨人守一门,看完才懂国家真高明!

小鹿姐姐情感说
2026-09-29 08:13:43
无底线了!内塔尼亚胡之子被伊朗特工暗杀,弃行李连夜逃回以色列

无底线了!内塔尼亚胡之子被伊朗特工暗杀,弃行李连夜逃回以色列

梦史
2026-08-29 06:21:20
美国媒体确认了:美国总统特朗普计划通过放宽对俄罗斯经济制裁,来改善与俄罗斯的关系,并达成商业协议

美国媒体确认了:美国总统特朗普计划通过放宽对俄罗斯经济制裁,来改善与俄罗斯的关系,并达成商业协议

吉刻新闻
2026-09-30 13:04:15
国庆高速免费时间定了!9月28日上高速也能免费?车主出发要懂

国庆高速免费时间定了!9月28日上高速也能免费?车主出发要懂

琴音缭绕回
2026-09-30 07:55:14
德国前政府高官发声:别以历史原因忽略以色列本性

德国前政府高官发声:别以历史原因忽略以色列本性

澎湃新闻
2026-09-29 23:03:15
最小红军向轩:7岁参军,9岁跟随部队走完长征,1955年授衔大典,他被授予什么军衔?

最小红军向轩:7岁参军,9岁跟随部队走完长征,1955年授衔大典,他被授予什么军衔?

磊子讲史
2026-09-17 16:42:41
叶子楣参加朋友生日会,瘦成干尸大胸垂到肚,合照搂腰尬笑超僵硬

叶子楣参加朋友生日会,瘦成干尸大胸垂到肚,合照搂腰尬笑超僵硬

娱圈办事处
2026-09-28 17:05:44
60多万买的车,修个大灯5.7万:85万辆孤儿车困局何解?

60多万买的车,修个大灯5.7万:85万辆孤儿车困局何解?

沙雕小琳琳
2026-09-29 01:22:07
胖东来只是按标准盖楼,却让整个土木人破防,甚至火到国外

胖东来只是按标准盖楼,却让整个土木人破防,甚至火到国外

社会日日鲜
2026-09-29 06:39:59
32岁女子“肉偿”300万债务,2022年33个男子接受服务后,多名男子举报她

32岁女子“肉偿”300万债务,2022年33个男子接受服务后,多名男子举报她

汉史趣闻
2026-09-19 10:57:18
2026-09-30 14:12:49
侃故事的阿庆
侃故事的阿庆
几分钟看完一部影视剧,诙谐幽默的娓娓道来
750文章数 9571关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

疑妙瓦底电诈园新据点卫星图公开 建筑群迅速"繁殖"

头条要闻

疑妙瓦底电诈园新据点卫星图公开 建筑群迅速"繁殖"

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

金鹰这夜,演员争辉,有惊喜,反差

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

5.1米大车跑云南盘山路,海狮08试驾体验超预期

态度原创

教育
时尚
房产
本地
军事航空

教育要闻

课堂、资源、平台三端发力,天府新区构建数字思政工作体系

老板,我的脑子好像忘在家里了

房产要闻

7字头上车,不到80万买三房!海口这个大盘放出狠价!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

军事要闻

伊朗最高领袖最新发声:伊朗现已变得独立、强大

无障碍浏览 进入关怀版