网易首页 > 网易号 > 正文 申请入驻

NeurIPS 2026 Spotlight|拒绝模型「自作主张」,VisInteract用交互搜索找回意图

0
分享至



本文作者分别来自香港理工大学以及字节跳动。共同第一作者许文鑫、卢锦伟来自香港理工大学。许文鑫是香港理工大学博士生,指导老师为张晨教授与魏骁勇教授。

数据要让人看懂,通常得先从数据库里查出来,再画成图。文本到可视化(Text-to-Vis)做的就是这件事:用户说出想看什么,系统去库里查询,再用图表把需要的数据展示出来。

你可能会觉得,现在的大模型已经非常强,这不过是小菜一碟。模型强是强,可需求得说清楚。通常,大多数用户没法一次把自己的需求表达完整。比如「把 2025 年 top-5 产品的月度营收画出来,按地区拆开」,听着已经很具体,可 top-5 按销售额还是按销量、退款算不算、数据库里到底有没有 2025 年的数据,这些都还没定。只出一次图,系统不会问,只会自己默默选定一种解释。

所以,要得到与用户真实意图相匹配的数据可视化,往往需要模型与用户进行多轮交互:缺的补上,含糊的问清,说错的改掉,一步步落到真正想看的那张图。这也是这项工作的研究背景。从适用性上看,这个场景要解决的是真实业务里的查数与出图。文生图在大模型里已经研究得很多,而企业用户有大量数据存在数据库里,要通过交互尽快把该看的内容锁定,这个意义会更大。

一旦把「需求往往说不完全」当成前提,现有研究就会同时碰到两个挑战。第一,现有基准数据集大多假设查询已经说清,而且很难评估开放的可视化输出,也就是同一句话,往往有不止一种合理画法。第二,现有方法还没法通过动态交互,主动把用户的真实意图问回来。查询不完美时,Text-to-Vis 更接近一种交互式的意图找回,而不只是一次出图。

针对这两个挑战,研究团队提出了VisInteract。这是一种面向不完美查询的动态交互式 Text-to-Vis 新范式。为了实现这种范式,团队发布了评测基准VisInteract-Bench,承认输入可以含糊、信息缺失甚至说错;同时提出基于蒙特卡洛树搜索的方法Vis-MCTS,让系统在查数、画图和追问之间分叉与回退,把真实意图问回来。

目前,该工作已被 NeurIPS 2026 接收为 Spotlight(292/30709 投稿)。



  • 论文标题:VisInteract: Towards Dynamic Interactive Text-to-Visualization under Imperfect Queries
  • 论文地址:https://arxiv.org/abs/2609.15182
  • 代码地址:https://github.com/wxxv/VisInteract

研究背景

带着前面的问题来看已有研究:在方法上,Text-to-Vis 从把自然语言翻译成 Vega-Lite 来画数据可视化,走到大模型写代码,再到多智能体流水线;评测上,NVBench、VisEval、MultiVis-Bench 等基准也把样本从几千扩到几万。但这些工作几乎都默认,用户那句话已经把真实意图说全了。系统要么一轮画完,要么等用户自己喊「这里改一下」,很少主动去问:这句话里缺了什么、有几种读法、哪一个字段根本不存在。

论文里还有一个更具体的交互例子。用户希望用饼图排出加州 K-12 入学人数最多的 15 个县,并指定要 2025 年的数。可数据库里并没有 2025 年的数据,用户真正想要的也不是饼图,而是按面积从大到小排的柱状图。一次出图的系统很容易在这些地方「自作主张」,交出一张看起来很专业、却对不上真实意图的图。

挑战一:现有基准既不刻画不完美输入,也很难评价开放输出。输入端,真实查询常常带有歧义、信息缺失或事实错误,但现有基准大多是单轮的,或者只提供事先写好的静态反馈。相邻的 Text-to-SQL 领域已经开始做动态澄清,而 Text-to-Vis 却还缺一个对应基准,而且还要额外处理看图反馈。输出端同样更刁:SQL 的结果集对不对,至少有一把相对干净的尺子;但是在 Text-to-Vis 中,同一句分析意图,柱状图、折线图、颜色怎么映射,往往都能算「一种对」。用精确匹配去罚「对了但画法不同」的图,会把「需求满不满足」和「实现好不好看」混为一谈。

挑战二:现有方法无法通过动态交互,主动找回用户意图。流水线方法一轮画完,不再跟用户说话;面向歧义的方法只枚举一组固定候选;基于反馈的变体,也多半是等用户自己改,并且只沿一条轨迹修。它们都很难从一开始的错误假设里退回来,更难系统地探索设计空间,最终无法收敛到用户真正想看的图。

这两个缺口,正是 VisInteract 要补的:评测得承认输入不完美、输出开放;方法得能分叉、能回退,而不是一条路走到黑。



图 1:三种 Text-to-Vis 范式对比。左边默认查询已经说清,中间只沿一条轨迹修图;VisInteract 则通过多轮交互,从不完美查询里把真实意图问回来。

基准构建

为了应对第一个挑战,论文发布了 VisInteract-Bench。就其所知,这是第一个面向动态交互式 Text-to-Vis 的基准:1098 条样本、11 个数据库、75 张表,覆盖体育、娱乐、教育、金融、医疗等 7 个领域,每条样本平均约 4.7 个关键特征。输入是事后注入故意不完美的自然语言查询,大约 61% 的样本带歧义,69% 带事实错误;交互是多轮、多模态的,而且会跟着系统输出变化,不是事先写好的剧本。如表 1 所示,现有基准要么假设查询已经说清,要么只提供静态交互;VisInteract-Bench 则同时覆盖不完美查询、动态交互和多模态反馈。



表 1:现有 Text-to-Vis 基准对比。VisInteract-Bench 同时覆盖动态交互、多模态反馈和不完美查询。

VisInteract-Bench 还设计了模拟用户的 User Agent。它知道标准答案,包括关键特征、参考代码和参考图,但不主动交底;系统如果直接索要意图,它会拒绝。文字追问只回答问到的那几条特征,看图反馈只说哪里不对,不说怎么改。文字负责问清过滤、聚合这类数据层含糊,看图负责抓住代码看起来没错、画出来却出问题的地方。

输出端的评测采用的是基于 LLM-as-Judge 的双视角评估。代码裁判检查程序是否满足每条关键特征,图表裁判则检查渲染结果是否满足每条关键特征。两边都过,才算这条特征过关。主指标是 Task Score:一个样本的全部关键特征都满足,才算这个任务做成。该评测的设计看的是关键特征有没有满足,而不是生成结果是否和参考图一模一样,保证了 Text-to-Vis 评估的开放性。

核心方法


为了应对第二个挑战,VisInteract 把动态交互式 Text-to-Vis 建模成一个部分可观测的序贯决策:系统能看到不完美查询和数据库,却看不到用户真正的意图,只能通过文字追问和看图反馈拿到间接证据。单链路的 ReAct 很难处理这件事——它一旦在第一步走错,后面基本只能将错就错。论文因此选择蒙特卡洛树搜索作为骨架,提出 Vis-MCTS。

但直接把下棋用的 MCTS 搬过来,会撞上三堵墙。第一,合法走法是无限的:一步可以是任意一条 SQL、一段画图代码,或一个自然语言问题,把所有孩子节点展开,树会在第一步炸开。第二,问到的话不能只服务一条路:经典搜索里每条路径各问各的,同一句「按销售额排」可能被反复消耗。第三,一个总分会连坐:用户说「数是对的,图的类型错了」只给 2 分,如果把这 2 分均匀回传,写对 SQL 的那一步会替画错的图背锅。

Vis-MCTS 的整体框架主要由三部分组成,分别对应这三堵墙。第一部分是带渐进加宽的选择与扩展。系统在查 SQL、画 Altair 图、向用户提问和结束这四类动作之间分叉;一个节点被访问得越多,才允许多长出几个分叉,并且设了硬上限。同时用多样性提示和去重,避免模型在同一个上下文里反复写出几乎一样的代码。第二部分是带跨路径记忆的模拟过程。一条分支上问到的澄清、看到的批评,会被写成两份全局记忆:所有文字问答,以及所有看图打分与批评。一条路上问清了,整棵树都能用,而不必为同一句澄清重复付出成本。第三部分是维度感知的奖励分解。用户给出的一个满意度分数,会被拆成数据是否忠实、视觉设计是否对、意图是否对齐,再分别回传到 SQL 节点、画图节点和追问节点。拆完还会锚定回原来的用户分数,避免模型打分的习惯把总分漂走。

论文中的一个例子是:用户反馈「我要的是按面积从大到小排的柱状图」,满意度只有 2 分。拆开之后,数据维度是 10 分,图表设计是 3 分,意图对齐是 2 分。查数那一步拿到更高回报,画错图类型的那一步被单独压低。若是均匀回传,三步都会拿到同一个低分,对的 SQL 就被错的图拖下水。



图 2:Vis-MCTS 方法总览。搜索在查数、画图和追问之间分叉,跨路径共享反馈,再按数据、设计和意图回传分数。

实验结果

论文在 VisInteract-Bench 上对 Vis-MCTS 进行了评估,骨干模型分别使用 Qwen3.5-flash 和 Gemini-3.1-flash-lite-preview。对照既包括不与用户交互的方法 Self-Correction LLM 和 nvAgent,也包括会交互的方法 ReAct、Best-of-N ReAct,以及 MultiVis-Agent。所有方法共用对齐后的工具和 User Agent,差别只在搜索方式。

结果显示,Vis-MCTS 在两个骨干,以及代码、图表、Merge 全部口径上都取得了最好成绩,图的可渲染率均为 100%,整体表现非常稳定。



表 2:VisInteract-Bench 上的主实验结果。蓝色为最优,浅蓝为次优。

具体来看,在最严格的 Merge Task Score 上,也就是代码和图表的所有关键特征都要满足时,Vis-MCTS 在 Qwen 上达到 51.46%,在 Gemini 上达到 57.19%。相对最强交互基线 Best-of-N,两端分别高出 13.40% 和 16.27%;相对不交互的自我纠错(7.38% / 10.66%),任务成功率超过 5 倍。代码视角的 Task Score,也从最强基线的 50.00% / 54.79% 提升到 61.66% / 67.21%。

同一笔 10 次预算,把 10 条链路各跑各的,收益并不稳:Qwen 上 Best-of-N 比单条 ReAct 高约 9%,Gemini 上却只高约 1.3%。树搜索的好处是另一件事:好的前缀可以复用,走死的路可以退回,问过的话整棵树都能用。

论文中的消融实验也支持了这套设计的有效性。以 Qwen 的 Merge Task Score 为例,完整模型为 51.46%;一旦去掉视觉反馈,分数掉到 24.24%,下降最明显,因为搜索失去了终点信号;去掉跨路径记忆后为 34.06%;去掉奖励分解后为 43.26%;去掉文字追问后为 44.08%。这说明 Vis-MCTS 的提升并不来自某个单独技巧,而是来自「分叉回退 + 交互共享 + 按错因回传」这一整套机制的协同作用。



表 3:Vis-MCTS 各模块消融(骨干为 Qwen3.5-flash)。

由于评测使用了大模型裁判,论文还做了交叉验证:另换一个大模型家族的 GPT 裁判,并加入人工专家。如图所示,两两 Cohen's Kappa 与三者的 Fleiss' Kappa 都超过 0.81 的「几乎完全一致」线。Qwen 裁判和人的对齐程度,与 GPT 和人的对齐程度相当,说明表中的差距并不是某一家裁判的偏好。



图 3:裁判一致性。两两 Cohen's Kappa 与三者 Fleiss' Kappa 均超过 0.81。

以下是 Vis-MCTS 的一个交互案例。面对同时带有事实错误和图表类型不匹配的不完美查询,系统通过追问和看图反馈逐步收敛,维度感知的奖励分解也只单独压低了画错图的那一步。



图 4:Vis-MCTS 的交互案例。系统通过追问和看图反馈,从不完美查询逐步收敛到用户真正想要的图。

总结与展望

这项工作的价值,不只是提出一个新的画图方法,更在于同时补上评测和方法两端:Text-to-Vis 不应只是「一句话进、一张图出」,而应是从不完美查询里找回真实意图。VisInteract-Bench 让评测承认输入可以含糊、缺失甚至说错;Vis-MCTS 则决定什么时候问、问什么,以及用户看完图摇头之后,下一步该改数据、改设计,还是改自己对意图的理解。对企业用户来说,大量数据本来就在数据库里,通过多轮交互把该看的内容尽快锁定,比一次性出图更接近日常工作。

当然,模拟用户的 User Agent 比真人的反馈理想,多轮搜索也更贵。换句话说,这项工作并不是终点,但它让画图系统更明确地拥有了「先问清楚,再把图画对」的中间过程。未来如果进一步结合更真实的用户反馈、更丰富的可视化语法,系统或许不仅能交出更准确的图,还能更好地解释「为什么这样画」。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
据说,每天有3万人退场

据说,每天有3万人退场

一条要飞跃的咸鱼
2026-10-07 08:49:43
企业退休人员养老金真实分布:四成人拿 2000-3000,你在第几层?

企业退休人员养老金真实分布:四成人拿 2000-3000,你在第几层?

陈博世财经
2026-10-08 14:04:13
秋日消费,新意扑面来(探访)

秋日消费,新意扑面来(探访)

人民网
2026-10-08 06:25:47
太意外!足协紧急研判换帅风波,换帅成本曝光,热苏斯帅位被锁死

太意外!足协紧急研判换帅风波,换帅成本曝光,热苏斯帅位被锁死

带你领略快乐真谛
2026-10-07 17:31:25
战术执行太完美了!周启豪横扫复仇张本智和晋级中国大满贯8强!

战术执行太完美了!周启豪横扫复仇张本智和晋级中国大满贯8强!

篮球资讯达人
2026-10-08 14:13:43
冯峰:黄晟豪从国足回来后第一时间表态能出战,这让我很感动

冯峰:黄晟豪从国足回来后第一时间表态能出战,这让我很感动

懂球帝
2026-10-08 12:21:35
A股两大板块,逆市走强!

A股两大板块,逆市走强!

证券时报
2026-10-08 13:10:03
黄奇帆预言中国未来房地产走向,今年已应验,明年大概率也是对的

黄奇帆预言中国未来房地产走向,今年已应验,明年大概率也是对的

专业聊房君
2026-10-07 15:31:47
2599元一桌的婚宴14道菜上错7道!宴会中心致歉:订单复核出现严重疏漏

2599元一桌的婚宴14道菜上错7道!宴会中心致歉:订单复核出现严重疏漏

极目新闻
2026-10-08 09:53:26
14票定罪莎拉或被推翻,2名参议员向最高法院请愿,强调裁定违宪

14票定罪莎拉或被推翻,2名参议员向最高法院请愿,强调裁定违宪

光电科技君
2026-10-08 11:57:00
今天14时28分,江西正式进入......

今天14时28分,江西正式进入......

南昌青云谱发布
2026-10-08 10:01:36
太提气了!周启豪职业生涯第一次战胜张本智和,3-0打破交手魔咒,晋级男单八强,王皓、王励勤到场助威

太提气了!周启豪职业生涯第一次战胜张本智和,3-0打破交手魔咒,晋级男单八强,王皓、王励勤到场助威

开成运动会
2026-10-08 14:52:20
公路车骑行服,熟女骑行穿搭,利落面料勾勒饱满曲线

公路车骑行服,熟女骑行穿搭,利落面料勾勒饱满曲线

只要高兴就好
2026-09-24 11:58:50
听完毛岸英牺牲详情后,毛主席忽然问彭德怀:我的岸英是否真的勇敢?

听完毛岸英牺牲详情后,毛主席忽然问彭德怀:我的岸英是否真的勇敢?

谈古论今历史有道
2026-10-08 12:20:08
国庆自驾2300公里,油车花了886块,电车花了多少?算完沉默了

国庆自驾2300公里,油车花了886块,电车花了多少?算完沉默了

侃故事的阿庆
2026-10-07 17:59:48
干儿子打三十多年光棍,干妈于心不忍,出手帮他得偿所愿

干儿子打三十多年光棍,干妈于心不忍,出手帮他得偿所愿

观观说事
2026-10-07 14:20:03
演员彭玉去世,曾被观众亲切称为“荧屏母亲专业户”

演员彭玉去世,曾被观众亲切称为“荧屏母亲专业户”

观察者网
2026-10-08 11:11:09
iPhone 17毫无预兆迎来大幅降价,现在下手到底算不算捡漏

iPhone 17毫无预兆迎来大幅降价,现在下手到底算不算捡漏

小柱解说游戏
2026-10-08 02:11:00
为何发达国家,不流行支付宝和微信支付?周小川一句话说透了真相

为何发达国家,不流行支付宝和微信支付?周小川一句话说透了真相

平说财经
2026-10-06 22:39:21
恩断义绝!炸平整栋大楼后,朝鲜宣布永远关闭边境,金与正放狠话

恩断义绝!炸平整栋大楼后,朝鲜宣布永远关闭边境,金与正放狠话

不似少年游
2026-10-07 07:14:42
2026-10-08 15:44:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14149文章数 142745关注度
往期回顾 全部

科技要闻

江淮汽车回应"尊界V800刹车踏板支架断裂"

头条要闻

女子连麦张雪称男友在ICU申请退车款被驳回 客服回应

头条要闻

女子连麦张雪称男友在ICU申请退车款被驳回 客服回应

体育要闻

梅西社媒发文告别国家队 C罗点赞留言:致敬 拥抱

娱乐要闻

给吴奇隆点赞的同时,再看蔡康永事件

财经要闻

“AI央行”英伟达的“千亿资本局”

汽车要闻

特别版配色/碳纤尾翼 2027款深蓝L06将于10月9日上市

态度原创

手机
教育
健康
本地
公开课

手机要闻

“卖出去也不赚钱”:消息称三星手机2026Q4最高减产30%

教育要闻

“这种家才值得回”,家长晒女儿放假前准备,网友:隔着屏幕都感到了幸福

痘坑留下后,还能填平吗?

本地新闻

转型再出发 奋勇打头阵

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版