网易首页 > 网易号 > 正文 申请入驻

NTT研究院打造"AI旅游会议":让多个A...

0
分享至

来源:市场资讯

(来源:科技行者)


这项由日本NTT公司研究人员开展的工作,以预印本形式发布于2026年7月,论文编号为arXiv:2607.18806,感兴趣的读者可通过该编号在arXiv平台查阅完整原文。

你有没有遇到过这种头疼的场景?

朋友圈里计划一次出游,三五个人各有想法:有人要逛古迹,有人要吃美食,有人只想省钱,有人体力不好要控制步行距离。群聊里讨论来讨论去,消息刷到几百条,最后要么是嗓门最大的人说了算,要么是没有主见的人委屈妥协,要么干脆散伙。

这个让人头疼的问题,NTT的研究团队决定用一种新颖的方式来解决:让多个拥有不同"性格"和"偏好"的AI,模拟真实的人类讨论,自己协商、争论、投票,最终商量出一份大家都能接受的旅行计划。他们把这套系统叫做"AI Tour Meeting"(AI旅游会议)。

这个框架的意义不仅仅在于帮人规划旅行。更深层的价值在于,它提供了一个可以观察多个AI如何在分歧中寻求共识的"实验室",帮助研究人员理解AI在群体决策中的行为规律,同时也能用来测试和评估现有的团体旅行推荐系统。与此同时,它还有一个很实用的应用场景:假如你们小组里有人临时来不了,可以根据他的喜好创建一个AI"替身",让这个AI代表他参与讨论,确保缺席者的意见也被纳入考量。

一、这套"AI圆桌会议"到底是怎么运作的?

整个框架的运作逻辑,可以用一场真实的公司会议来类比。在会议开始之前,你需要确定两件事:参会者是谁,以及会议怎么开。

先说参会者。每一个AI参与者都被赋予了一套完整的"人设",就像给演员写角色背景一样详细。这套人设包含名字、个人经历与背景、性格特点、对旅行的偏好、这次旅行的个人目标、在会议中的角色(是主持人还是普通参会者)、说话的语气风格,以及说服别人时惯用的方式。

关于说服方式,框架提供了两种截然不同的风格。一种是"主观表达型",就像一个很感性的朋友,不断强调"我觉得这个地方特别棒,符合我的品味";另一种是"对比分析型",更像一个理性的分析师,会拿出数字和事实说话,比如"你看,我提的这条路线比现在的方案少花200元,而且能多去一个景点"。当然也可以选择两种混用,或者让AI根据当时的情形自己判断哪种方式更合适。

每个AI参与者背后可以接入不同的语言模型,可以是商业模型(比如OpenAI的GPT系列),也可以是在本地服务器上运行的开源模型(通过vLLM或Ollama部署)。每个参与者的模型类型、随机程度(temperature参数)、记忆管理方式都可以单独配置,灵活程度相当高。

再说会议本身的结构。一次完整的AI旅游会议由全局目标、参与者名单、约束条件、发言规则和投票规则五个要素组成。全局目标是所有人共同遵守的大方向,比如"规划一次东京一日游"。约束条件则是硬性限制,包括出行日期、总预算和时间窗口(比如只能在早上九点到晚上六点之间活动)。每个参与者在这些约束条件下追求自己的个人目标,这就造成了分歧,也推动了讨论的进行。

整个会议在一份具体的"行程单"格式上展开讨论。每一份被提出的行程单,都包含一个按顺序排列的目的地序列,每个目的地都注明了名称、描述、费用、到达时间、停留时长,以及从上一个地点出发的交通方式、交通费用和耗时。这种结构化的格式确保了AI在讨论时有具体的内容可以评判和修改,而不是只讲模糊的意见。

二、会议的节奏:对话与投票交替进行

会议的推进方式有点像一场辩论赛的精简版,分为"对话阶段"和"投票阶段",两者交替进行。

在对话阶段,参与者按照规定的顺序轮流发言。每个人在自己的发言回合里,可以做好几件事:可以通过网络搜索查询某个景点的具体费用或交通时间;可以向其他参与者提问,收集他们的意见;可以静下来"反思"一下,整理当前讨论的思路;当然,最重要的,是可以提出一份具体的行程方案。

每个回合必须以一个"终结动作"收尾。在对话阶段,终结动作有三种选择:提出新的行程方案、表示对当前方案已经满意、或者选择本轮不表态直接跳过。一旦有人提出了新的行程方案,会议立刻进入投票阶段。

投票阶段里,除了提案人以外的所有参与者,都需要对这份方案表态。在表态之前,他们同样可以先搜索信息、向别人提问或者思考一番,然后做出"接受"或"拒绝"的最终决定。投票结果按照预先设定的投票规则来判定。如果方案通过,当前的行程单就被这份新方案取代;如果被否决,原来的方案继续保留,会议回到对话阶段,轮到提案人之后的下一位继续发言。

当所有参与者在连续的回合中都表示"对当前方案满意"时,会议达成共识,圆满结束。当然,为了防止会议无限循环下去,系统也设置了最大发言轮数和最长运行时间的上限,确保会议总会有个终点。

这个"对话—投票—对话"的循环过程,用一套形式化的算法描述得非常清晰:系统维护一个计数器,记录连续表示"满意"的参与者数量。每当有人提出新方案,计数器清零,重新开始。只有当计数器的数值等于总参与人数时,会议才算真正结束,此时的行程单就是最终结果。

三、发言顺序和投票方式,可以按需定制

这套框架在"游戏规则"的设计上给了使用者相当大的自由度,发言规则和投票规则都有多种选项可以选择。

发言规则方面,有四种基本模式。"轮流发言"是最简单的,大家按照固定顺序一人一轮;"邀请制"则是由当前发言者在结束时点名谁来接着讲,更接近真实会议中的互动方式;"主持人制"是在每个人发言之后,插入一个额外的主持人回合,由主持人决定下一个发言者是谁;"随机制"就是随机确定下一个发言者。此外还有两个可选的附加设置:开启"均衡模式"后,发言被组织成一轮一轮的循环,确保每位参与者在每轮里都有机会说话,避免某些人被边缘化;开启"自愿模式"后,参与者可以选择在自己的回合里什么都不说,直接跳过,只有真正有话说的人才需要开口。

投票规则方面,框架提供了五种选择。"多数票制"是最常见的民主方式,获得超过半数的赞成票方案通过;"全票制"要求所有人都同意,门槛极高;"单一决策者制"是让指定的某一个参与者独自决定方案的命运;"最高满意度制"和"最低不满意度制"这两种更有意思,参与者不再投二选一的票,而是给方案打一个1到10分的分数,前者看的是总分,后者看的是最低分(即最不满意的那个人的分数),后者的逻辑是:一个方案哪怕总分再高,只要有人极度反对,也不应该通过。

四、框架有多好用?用不同大小的AI模型测了一遍

光有设计还不够,研究团队还做了严格的测试,看看这套框架在不同能力的AI模型下表现如何。

测试方法是这样的:先用一个能力较强的模型(GPT-5.4 mini)生成50个不同的"会议场景",每个场景里三名参与者的偏好部分重叠、存在一定程度的分歧,但分歧不算特别激烈,通过协商可以解决。然后,用五种不同大小和能力的模型来驱动这50场会议,看看各自表现如何。这五种模型分别是:Qwen3.5的2B、4B、9B版本(数字越大代表模型越大、能力通常越强),以及两个商业模型gpt-oss-20b和gpt-5.4-mini。所有会议都使用轮流发言规则和多数票投票规则,设置100轮的上限,时间窗口为早九晚六,每位参与者预算为100美元。

测试结果相当清晰地说明了问题。能力最弱的Qwen3.5-2B,只有82%的会议能顺利完成(即在达成共识或触及上限之前,至少接受了一份行程方案),而且其中只有58%的会议是真正通过协商达成共识结束的,剩余的是被强制截止的。更糟糕的是,它提出的行程方案中有高达14.2%违反了时间或预算约束,而且频繁出现奇怪的行为——比如重复发同一条消息,或者拒绝某个方案时提到了一条根本不存在的"当前路线"。

而其他四种更强的模型,完成率都达到了100%,违规比例接近于零,行动失败率也极低。其中Qwen3.5-9B的表现尤为出色,违规率为0%,失败率仅0.1%,平均只需要12.8轮发言就能结束会议。GPT-5.4 mini虽然完成率也是100%,但共识率只有80%,意味着有20%的会议是在没有完全达成共识的情况下被截止的,这可能与该模型的某些倾向有关。

从成本角度看,不同模型的差异也很显著。Qwen3.5-9B每场会议消耗约13.4万个输入token和3.7万个输出token,而Qwen3.5-2B由于讨论更混乱、绕路更多,每场会议消耗的token高达710万个输入,是9B模型的五十多倍。这个对比直观地说明了:一个"够聪明"的模型,不仅结果更好,而且效率更高。

综合来看,Qwen3.5-4B是这套框架能够稳定运行的最低门槛,性能高于这个级别的模型都能让框架运转良好。

五、当AI们意见不合时,会发生什么?

框架能跑通只是第一步,更有趣的问题是:当参与者的偏好相互冲突时,AI们会怎么处理?这跟真实的人类讨论像不像?

研究团队专门设计了一个分析实验。他们把50个会议场景分成三组:第一组"一致型",三位AI参与者的偏好完全对齐,大家都想去差不多的地方;第二组"混合型",就是前面系统测试用的那种,偏好部分重叠有一定分歧;第三组"冲突型",三位参与者的偏好存在实质性矛盾,至少有一个人在某些方面必须做出让步才能达成协议。全部使用邀请制发言规则和Qwen3.5-9B。

每场会议结束后,研究团队还用LLM-as-a-judge(让另一个AI扮演评委)来评估每位参与者对最终行程的满意度,打1到10分。

结果显示出了非常自然的规律性。一致型会议平均只需要10.3轮就能结束,提出2.3次行程方案,共识率100%,平均满意度高达8.93分,只有0.7%的参与者对最终结果极度不满(满意度4分或以下,被称为"受害者")。

混合型会议稍微费劲一些,平均12.1轮,2.7次提案,共识率仍然100%,满意度8.39分,受害者比例1.3%。

冲突型会议则明显吃力得多:平均25.9轮才能结束,提案次数高达6.5次,共识率下降到94%,平均满意度跌至7.13分,受害者比例飙升到11.3%。

这组数据讲述了一个耳熟能详的故事:分歧越大,讨论越久,越难找到让所有人都满意的方案,被迫妥协的人也越多。AI的行为模式和人类社会中的群体讨论规律高度吻合——这本身就是一个很有价值的发现,说明这套框架确实能够模拟出真实的人类群体决策过程。

研究团队还从会议记录中提取了两个典型的案例,展示了AI在冲突情境下如何达成共识。第一个案例发生在一场首尔一日游的混合型会议里。一位叫Elena的AI参与者提出的方案被连续否决了九次。另一位参与者Jisoo实在等不下去了,直接问Elena:经过这15轮讨论,你是否愿意接受目前这份方案,好让我们结束会议?Elena承认自己对路上的街头小吃和清溪川散步念念不忘,但也看到了其他人的坚持,最终选择了妥协。在赛后评估中,Elena给这份方案打了3分,说明她是在真正不满意的情况下才接受的——这是一种被压力推动的妥协,而不是真心满意。

第二个案例则温馨得多,发生在一场马拉喀什一日游的冲突型会议里。Noah的方案被否决了两次之后,另一位参与者Leila自己站出来,提出了一份融合了Noah的需求的新方案,把Noah最想去的屋顶观景台纳入了行程,同时也保留了第三位参与者Camille最在意的宁静茶馆时光(虽然时间略有缩短)。这一次,Noah接受了,Camille虽然略有遗憾但也表示满意。Leila用一种调解者的姿态,打破了僵局。

这两种截然不同的共识路径——一种是被动妥协,一种是主动调解——在AI的讨论中自然浮现,令人印象深刻。

六、先说话还是后说话,影响有多大?

除了偏好冲突,研究团队还好奇另一个问题:在讨论中,发言顺序会影响一个人提案被接受的概率吗?毕竟在现实会议中,第一个发言的人往往有"定调"的作用,但也可能因为信息不足而打出"盲拳"。

这个实验的设计颇为严谨。研究团队把前面三种冲突程度的50场会议,各自再运行三遍,每次把三位参与者的座位(即发言顺序)进行轮换,覆盖所有可能的排列方式(这种方法在统计学上叫"拉丁方设计",目的是排除特定参与者偏好对顺序效应的干扰)。所有会议使用轮流发言规则。

结果在一致型组里,第一、二、三位发言者的提案接受率分别是62%、64%、66%,三者没有统计学上的显著差异——说明当大家都想去同样的地方时,谁先说都无所谓,方案总会被接受。

但到了混合型组,格局明显不同:第一位的接受率是43%,第二位是68%,第三位是73%。冲突型组的差距更加悬殊:第一位只有32%,第二位46%,第三位48%。

这意味着什么?在存在分歧的情况下,越晚发言的人,提案越容易被通过。原因合乎直觉:第一位发言者什么信息都没有,只能凭借对自身偏好的判断来提案,很难兼顾到其他人的需求。而后面发言的人,已经从前几轮的讨论、提案和投票结果中积累了大量信息,知道哪些地方被别人接受、哪些被拒绝,因此能够提出更精准地迎合多方需求的方案。

有趣的是,数据还揭示了一个额外的细节:第一位发言者中,那些被接受的提案大多数是在先向其他人提问、收集意见之后才提出的;而后面发言的人,往往不需要专门提问,仅靠之前讨论中自然积累的信息就能提出被接受的方案。换句话说,第一个吃螃蟹的人要获得成功,需要更主动地去探索,而后来者则可以"坐享其成",把前人的讨论当成免费的市场调研。

七、给人类留了一把椅子

这套框架还有一个很人性化的设计:真实的人类用户也可以参与进来,和AI一起开会。在轮到人类发言时,系统会提供一个聊天界面,人类可以执行和AI完全相同的操作——搜索信息、向AI提问、提出行程方案或者投票表态。

在提出行程方案时,人类可以手动修改每个目的地的细节,也可以点击"用AI生成"按钮,把自己的想法描述给AI,让AI帮忙补全一份完整规范的行程方案。

这个人机混合模式的最直接应用场景,就是前面提到的"替缺席朋友发声"。假如你们五人小组里有两个人出差来不了,你可以根据他们平时的偏好,分别为他们配置一个AI"替身",让这个AI代表他们参与你与另外两位朋友的讨论,确保行程计划真正考虑到了所有人的需求。

八、用的人越多,系统会不会崩?

为了验证框架的可扩展性,研究团队还额外测试了当参与者人数增加时,系统能否稳定运作。他们同样生成了50个合成场景,分别测试了5人和10人规模的会议(用Qwen3.5-9B驱动),其他设置与三人场景保持一致。

结果令人放心:5人组和10人组的完成率均为100%,10人组的共识率也高达96%,违规率分别为1.6%和2.4%,仍然处于很低的水平。不过代价是会议变长了——5人组平均需要25.4轮,10人组则需要68.6轮,比三人组的12.8轮高出了很多,而且增长速度略快于参与者数量的增长比例。这说明随着讨论人数增加,协调难度会非线性上升,但在实际可用的范围内。

token消耗也相应大幅增加:三人组平均消耗约17万个token,5人组约76万,10人组约348万。这意味着如果在商业API上运行大规模会议,成本会相当可观,使用本地部署的开源模型可以有效控制费用。

九、这套系统可以怎么用?

从使用方式来看,这个框架提供了两种接入途径。一是图形界面,提供了清晰直观的操作页面:左侧配置每位参与者的详细信息,中间设置会议的全局规则和约束条件,右侧是实时滚动的会议对话记录,最右边则是分析仪表盘,可以可视化地查看各类统计指标。二是Python代码接口,只需要几行代码,就能配置好一场会议并启动运行,非常适合需要批量生成和分析大量会议的研究人员。

系统还内置了丰富的监控和分析功能。系统层面的指标包括token消耗量、操作失败重试次数、行程方案中违反时间约束的情况;讨论动态层面的指标包括发言轮数、消息历史、各类操作的执行分布、投票和打分的分布情况、以及历次提案的具体内容和演变过程。这些数据可以帮助研究者从多个维度深入分析AI群体决策的行为模式。

归根结底,这项工作做的是一件颇具想象力的事情:把旅行规划这个烦人但日常的问题,转化成了一个研究AI如何在多元偏好中寻找平衡点的实验平台。它证明了AI在处理有分歧的群体讨论时,确实能涌现出类似人类的行为模式——比如越晚发言越有优势、强调共同妥协可能让部分人心有不甘、以及善意的第三方调解有时比反复对抗更高效地打破僵局。

当然,这项研究更多是一个开端,而不是终点。AI生成的"人设"和真实人类有多大的差距?这种模拟的结论能不能直接指导真实的推荐系统设计?随着模型越来越强,AI的协商行为又会如何演变?这些都是值得深入探索的方向。有兴趣的读者可以通过arXiv编号2607.18806找到完整论文,也可以访问论文中提供的GitHub代码仓库,亲自动手试试让几个AI帮你规划下一次旅行。

Q&A

Q1:AI Tour Meeting框架支持哪些投票方式?

A:框架提供五种投票规则。多数票制下,超过半数赞成即通过;全票制要求所有人同意;单一决策者制由指定参与者独自决定;最高满意度制看的是所有参与者打分的总和;最低不满意度制则看的是最低那个分数,确保不会出现有人极度反对还能通过的情况。参与者在后两种规则下打的是1到10分的分数,而非简单的赞成或反对。

Q2:AI Tour Meeting框架最少需要多强的AI模型才能稳定运行?

A:根据系统测试结果,Qwen3.5-4B是这套框架能够稳定运行的最低门槛。比这更小的Qwen3.5-2B会出现重复消息、引用不存在路线等异常行为,完成率只有82%,违规率高达14.2%。而Qwen3.5-4B及以上级别的模型,完成率均达到100%,违规率和失败率都极低。

Q3:发言顺序对AI旅游规划讨论有什么影响?

A:在偏好存在分歧的情况下,越晚发言的参与者,提案被接受的概率越高。以冲突型会议为例,第一位发言者的提案接受率只有32%,而第三位高达48%。原因是后发言者能利用前面讨论积累的信息来优化提案,而第一位发言者缺乏参考,通常需要先主动提问才能提高成功率。偏好完全一致时,发言顺序则没有明显影响。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“反诈老陈”找到新工作,月薪15000元,本人回应:还在考察期,辞掉民警工作后走了弯路,今年直播收入税前10多万元,找个工作挣点生活费

“反诈老陈”找到新工作,月薪15000元,本人回应:还在考察期,辞掉民警工作后走了弯路,今年直播收入税前10多万元,找个工作挣点生活费

大风新闻
2026-08-19 12:04:06
武汉世界第一争夺战:赵心童手握2350积分优势,丁俊晖或送助攻!

武汉世界第一争夺战:赵心童手握2350积分优势,丁俊晖或送助攻!

夜深聊球
2026-08-19 20:58:20
人民日报锐评杭州酒局!只字未提赵海峰郁廷栋,句句都在敲打他们

人民日报锐评杭州酒局!只字未提赵海峰郁廷栋,句句都在敲打他们

江启
2026-08-20 05:46:13
中元节鬼门大开,孟婆提醒:勿要闯入这几处禁地

中元节鬼门大开,孟婆提醒:勿要闯入这几处禁地

第四思维
2025-09-08 09:35:22
二度拿下欧洲金靴!凯恩:当初一心想回英超,现在渴望已经变淡

二度拿下欧洲金靴!凯恩:当初一心想回英超,现在渴望已经变淡

用冷眼洞悉世界
2026-08-20 11:37:30
王志文:不要和任何人走得太近,因为你不知道什么时候会反目成仇|保持距离,才是最好的保护

王志文:不要和任何人走得太近,因为你不知道什么时候会反目成仇|保持距离,才是最好的保护

杏花烟雨江南的碧园
2026-07-28 15:15:03
围攻小球迷!三名申花球迷被拘留,曹赟定怒批:生活里最底层的人

围攻小球迷!三名申花球迷被拘留,曹赟定怒批:生活里最底层的人

代古龙侃球
2026-08-20 09:32:05
青岛崂山警方通报“女子在公园被男子辱骂”:违法行为人已到案

青岛崂山警方通报“女子在公园被男子辱骂”:违法行为人已到案

新京报
2026-08-20 09:44:04
5880亿账单谁来付?乌克兰最反俄的前总统说:当年要听中国就好了

5880亿账单谁来付?乌克兰最反俄的前总统说:当年要听中国就好了

福建睿平
2026-08-19 08:07:42
上海男子病重瞒着家人买公墓,发朋友圈称买房,半小时后母亲来电

上海男子病重瞒着家人买公墓,发朋友圈称买房,半小时后母亲来电

童童聊娱乐啊
2026-08-20 00:06:09
大的要来了?美日政府签字,就等废掉中国王牌,中方先断货金属钇

大的要来了?美日政府签字,就等废掉中国王牌,中方先断货金属钇

影孖看世界
2026-08-18 23:50:17
许家印判处无期徒刑,并处没收个人全部财产,恒大集团、恒大地产等案一审宣判

许家印判处无期徒刑,并处没收个人全部财产,恒大集团、恒大地产等案一审宣判

都市快报橙柿互动
2026-08-20 12:26:33
国乒亚运名单最终确定,王励勤布局深远,林诗栋成全队唯一

国乒亚运名单最终确定,王励勤布局深远,林诗栋成全队唯一

刘哥谈体育
2026-08-20 04:04:50
正式退出,陈幸同暂离队,前往四川,退役安置或曝光

正式退出,陈幸同暂离队,前往四川,退役安置或曝光

泥说体育
2026-07-13 22:09:44
李鹏总理年轻时有多帅?1959年在吉林的留影,他31岁英俊潇洒

李鹏总理年轻时有多帅?1959年在吉林的留影,他31岁英俊潇洒

春秋砚
2026-08-19 13:45:08
两个“管培生”的冲突!杭州60亿地块饭局背后,施暴人赵海峰本身也是管培生出身

两个“管培生”的冲突!杭州60亿地块饭局背后,施暴人赵海峰本身也是管培生出身

火山詩话
2026-08-19 08:04:24
赵露思演唱会,比基尼加持,纤细小腰,白嫩肌肤,极具观赏

赵露思演唱会,比基尼加持,纤细小腰,白嫩肌肤,极具观赏

吃瓜党二号头目
2026-08-08 12:30:25
1972年,尼克松与江青的合影当中,身后长相清秀的女翻译,是谁?

1972年,尼克松与江青的合影当中,身后长相清秀的女翻译,是谁?

舆图看世界
2026-08-06 10:15:03
同事一个月请了3次丧假,结果领导说:你家亲戚死光了?然后同事就给了领导一耳光!我们上去拉偏架,最后领导被揍的鼻青脸肿,还降职调岗

同事一个月请了3次丧假,结果领导说:你家亲戚死光了?然后同事就给了领导一耳光!我们上去拉偏架,最后领导被揍的鼻青脸肿,还降职调岗

品读时刻
2026-07-29 09:08:42
经济学家因与普京的叙事相悖遭免职  大英首相强势回应俄罗斯的威胁

经济学家因与普京的叙事相悖遭免职 大英首相强势回应俄罗斯的威胁

西楼饮月
2026-08-19 19:16:51
2026-08-20 13:04:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4483117文章数 9325关注度
往期回顾 全部

科技要闻

DeepSeek Harness更新多模态支持

头条要闻

许家印被判无期徒刑 恒大集团、恒大地产等案一审宣判

头条要闻

许家印被判无期徒刑 恒大集团、恒大地产等案一审宣判

体育要闻

拥有“儿皇梦”的罗德里,为何选择巴萨?

娱乐要闻

汪峰也没想到章子怡,挖到了一条财路

财经要闻

许家印被判处无期 恒大集团被罚88.2亿

汽车要闻

第二代家庭旗舰的样子 奕境X9预售价29.98万起

态度原创

手机
教育
亲子
时尚
军事航空

手机要闻

9月9日科技春晚 苹果华为小米新品或同天发布

教育要闻

2026雅思暑假班怎么选?先搞清楚这四件事,再对号入座不踩坑

亲子要闻

Cell | 不止是抗体!母乳靠肠菌代谢物,搭建宝宝肺部免疫防线

内娱还在三件套的时候,韩综已经卷到“扛大炮”了

军事要闻

弹药危机 美步入“战略更年期”的征兆

无障碍浏览 进入关怀版