网易首页 > 网易号 > 正文 申请入驻

NTT研究院打造"AI旅游会议":让多个AI替你和朋友一起规划旅行

0
分享至


这项由日本NTT公司研究人员开展的工作,以预印本形式发布于2026年7月,论文编号为arXiv:2607.18806,感兴趣的读者可通过该编号在arXiv平台查阅完整原文。

你有没有遇到过这种头疼的场景?

朋友圈里计划一次出游,三五个人各有想法:有人要逛古迹,有人要吃美食,有人只想省钱,有人体力不好要控制步行距离。群聊里讨论来讨论去,消息刷到几百条,最后要么是嗓门最大的人说了算,要么是没有主见的人委屈妥协,要么干脆散伙。

这个让人头疼的问题,NTT的研究团队决定用一种新颖的方式来解决:让多个拥有不同"性格"和"偏好"的AI,模拟真实的人类讨论,自己协商、争论、投票,最终商量出一份大家都能接受的旅行计划。他们把这套系统叫做"AI Tour Meeting"(AI旅游会议)。

这个框架的意义不仅仅在于帮人规划旅行。更深层的价值在于,它提供了一个可以观察多个AI如何在分歧中寻求共识的"实验室",帮助研究人员理解AI在群体决策中的行为规律,同时也能用来测试和评估现有的团体旅行推荐系统。与此同时,它还有一个很实用的应用场景:假如你们小组里有人临时来不了,可以根据他的喜好创建一个AI"替身",让这个AI代表他参与讨论,确保缺席者的意见也被纳入考量。

一、这套"AI圆桌会议"到底是怎么运作的?

整个框架的运作逻辑,可以用一场真实的公司会议来类比。在会议开始之前,你需要确定两件事:参会者是谁,以及会议怎么开。

先说参会者。每一个AI参与者都被赋予了一套完整的"人设",就像给演员写角色背景一样详细。这套人设包含名字、个人经历与背景、性格特点、对旅行的偏好、这次旅行的个人目标、在会议中的角色(是主持人还是普通参会者)、说话的语气风格,以及说服别人时惯用的方式。

关于说服方式,框架提供了两种截然不同的风格。一种是"主观表达型",就像一个很感性的朋友,不断强调"我觉得这个地方特别棒,符合我的品味";另一种是"对比分析型",更像一个理性的分析师,会拿出数字和事实说话,比如"你看,我提的这条路线比现在的方案少花200元,而且能多去一个景点"。当然也可以选择两种混用,或者让AI根据当时的情形自己判断哪种方式更合适。

每个AI参与者背后可以接入不同的语言模型,可以是商业模型(比如OpenAI的GPT系列),也可以是在本地服务器上运行的开源模型(通过vLLM或Ollama部署)。每个参与者的模型类型、随机程度(temperature参数)、记忆管理方式都可以单独配置,灵活程度相当高。

再说会议本身的结构。一次完整的AI旅游会议由全局目标、参与者名单、约束条件、发言规则和投票规则五个要素组成。全局目标是所有人共同遵守的大方向,比如"规划一次东京一日游"。约束条件则是硬性限制,包括出行日期、总预算和时间窗口(比如只能在早上九点到晚上六点之间活动)。每个参与者在这些约束条件下追求自己的个人目标,这就造成了分歧,也推动了讨论的进行。

整个会议在一份具体的"行程单"格式上展开讨论。每一份被提出的行程单,都包含一个按顺序排列的目的地序列,每个目的地都注明了名称、描述、费用、到达时间、停留时长,以及从上一个地点出发的交通方式、交通费用和耗时。这种结构化的格式确保了AI在讨论时有具体的内容可以评判和修改,而不是只讲模糊的意见。

二、会议的节奏:对话与投票交替进行

会议的推进方式有点像一场辩论赛的精简版,分为"对话阶段"和"投票阶段",两者交替进行。

在对话阶段,参与者按照规定的顺序轮流发言。每个人在自己的发言回合里,可以做好几件事:可以通过网络搜索查询某个景点的具体费用或交通时间;可以向其他参与者提问,收集他们的意见;可以静下来"反思"一下,整理当前讨论的思路;当然,最重要的,是可以提出一份具体的行程方案。

每个回合必须以一个"终结动作"收尾。在对话阶段,终结动作有三种选择:提出新的行程方案、表示对当前方案已经满意、或者选择本轮不表态直接跳过。一旦有人提出了新的行程方案,会议立刻进入投票阶段。

投票阶段里,除了提案人以外的所有参与者,都需要对这份方案表态。在表态之前,他们同样可以先搜索信息、向别人提问或者思考一番,然后做出"接受"或"拒绝"的最终决定。投票结果按照预先设定的投票规则来判定。如果方案通过,当前的行程单就被这份新方案取代;如果被否决,原来的方案继续保留,会议回到对话阶段,轮到提案人之后的下一位继续发言。

当所有参与者在连续的回合中都表示"对当前方案满意"时,会议达成共识,圆满结束。当然,为了防止会议无限循环下去,系统也设置了最大发言轮数和最长运行时间的上限,确保会议总会有个终点。

这个"对话—投票—对话"的循环过程,用一套形式化的算法描述得非常清晰:系统维护一个计数器,记录连续表示"满意"的参与者数量。每当有人提出新方案,计数器清零,重新开始。只有当计数器的数值等于总参与人数时,会议才算真正结束,此时的行程单就是最终结果。

三、发言顺序和投票方式,可以按需定制

这套框架在"游戏规则"的设计上给了使用者相当大的自由度,发言规则和投票规则都有多种选项可以选择。

发言规则方面,有四种基本模式。"轮流发言"是最简单的,大家按照固定顺序一人一轮;"邀请制"则是由当前发言者在结束时点名谁来接着讲,更接近真实会议中的互动方式;"主持人制"是在每个人发言之后,插入一个额外的主持人回合,由主持人决定下一个发言者是谁;"随机制"就是随机确定下一个发言者。此外还有两个可选的附加设置:开启"均衡模式"后,发言被组织成一轮一轮的循环,确保每位参与者在每轮里都有机会说话,避免某些人被边缘化;开启"自愿模式"后,参与者可以选择在自己的回合里什么都不说,直接跳过,只有真正有话说的人才需要开口。

投票规则方面,框架提供了五种选择。"多数票制"是最常见的民主方式,获得超过半数的赞成票方案通过;"全票制"要求所有人都同意,门槛极高;"单一决策者制"是让指定的某一个参与者独自决定方案的命运;"最高满意度制"和"最低不满意度制"这两种更有意思,参与者不再投二选一的票,而是给方案打一个1到10分的分数,前者看的是总分,后者看的是最低分(即最不满意的那个人的分数),后者的逻辑是:一个方案哪怕总分再高,只要有人极度反对,也不应该通过。

四、框架有多好用?用不同大小的AI模型测了一遍

光有设计还不够,研究团队还做了严格的测试,看看这套框架在不同能力的AI模型下表现如何。

测试方法是这样的:先用一个能力较强的模型(GPT-5.4 mini)生成50个不同的"会议场景",每个场景里三名参与者的偏好部分重叠、存在一定程度的分歧,但分歧不算特别激烈,通过协商可以解决。然后,用五种不同大小和能力的模型来驱动这50场会议,看看各自表现如何。这五种模型分别是:Qwen3.5的2B、4B、9B版本(数字越大代表模型越大、能力通常越强),以及两个商业模型gpt-oss-20b和gpt-5.4-mini。所有会议都使用轮流发言规则和多数票投票规则,设置100轮的上限,时间窗口为早九晚六,每位参与者预算为100美元。

测试结果相当清晰地说明了问题。能力最弱的Qwen3.5-2B,只有82%的会议能顺利完成(即在达成共识或触及上限之前,至少接受了一份行程方案),而且其中只有58%的会议是真正通过协商达成共识结束的,剩余的是被强制截止的。更糟糕的是,它提出的行程方案中有高达14.2%违反了时间或预算约束,而且频繁出现奇怪的行为——比如重复发同一条消息,或者拒绝某个方案时提到了一条根本不存在的"当前路线"。

而其他四种更强的模型,完成率都达到了100%,违规比例接近于零,行动失败率也极低。其中Qwen3.5-9B的表现尤为出色,违规率为0%,失败率仅0.1%,平均只需要12.8轮发言就能结束会议。GPT-5.4 mini虽然完成率也是100%,但共识率只有80%,意味着有20%的会议是在没有完全达成共识的情况下被截止的,这可能与该模型的某些倾向有关。

从成本角度看,不同模型的差异也很显著。Qwen3.5-9B每场会议消耗约13.4万个输入token和3.7万个输出token,而Qwen3.5-2B由于讨论更混乱、绕路更多,每场会议消耗的token高达710万个输入,是9B模型的五十多倍。这个对比直观地说明了:一个"够聪明"的模型,不仅结果更好,而且效率更高。

综合来看,Qwen3.5-4B是这套框架能够稳定运行的最低门槛,性能高于这个级别的模型都能让框架运转良好。

五、当AI们意见不合时,会发生什么?

框架能跑通只是第一步,更有趣的问题是:当参与者的偏好相互冲突时,AI们会怎么处理?这跟真实的人类讨论像不像?

研究团队专门设计了一个分析实验。他们把50个会议场景分成三组:第一组"一致型",三位AI参与者的偏好完全对齐,大家都想去差不多的地方;第二组"混合型",就是前面系统测试用的那种,偏好部分重叠有一定分歧;第三组"冲突型",三位参与者的偏好存在实质性矛盾,至少有一个人在某些方面必须做出让步才能达成协议。全部使用邀请制发言规则和Qwen3.5-9B。

每场会议结束后,研究团队还用LLM-as-a-judge(让另一个AI扮演评委)来评估每位参与者对最终行程的满意度,打1到10分。

结果显示出了非常自然的规律性。一致型会议平均只需要10.3轮就能结束,提出2.3次行程方案,共识率100%,平均满意度高达8.93分,只有0.7%的参与者对最终结果极度不满(满意度4分或以下,被称为"受害者")。

混合型会议稍微费劲一些,平均12.1轮,2.7次提案,共识率仍然100%,满意度8.39分,受害者比例1.3%。

冲突型会议则明显吃力得多:平均25.9轮才能结束,提案次数高达6.5次,共识率下降到94%,平均满意度跌至7.13分,受害者比例飙升到11.3%。

这组数据讲述了一个耳熟能详的故事:分歧越大,讨论越久,越难找到让所有人都满意的方案,被迫妥协的人也越多。AI的行为模式和人类社会中的群体讨论规律高度吻合——这本身就是一个很有价值的发现,说明这套框架确实能够模拟出真实的人类群体决策过程。

研究团队还从会议记录中提取了两个典型的案例,展示了AI在冲突情境下如何达成共识。第一个案例发生在一场首尔一日游的混合型会议里。一位叫Elena的AI参与者提出的方案被连续否决了九次。另一位参与者Jisoo实在等不下去了,直接问Elena:经过这15轮讨论,你是否愿意接受目前这份方案,好让我们结束会议?Elena承认自己对路上的街头小吃和清溪川散步念念不忘,但也看到了其他人的坚持,最终选择了妥协。在赛后评估中,Elena给这份方案打了3分,说明她是在真正不满意的情况下才接受的——这是一种被压力推动的妥协,而不是真心满意。

第二个案例则温馨得多,发生在一场马拉喀什一日游的冲突型会议里。Noah的方案被否决了两次之后,另一位参与者Leila自己站出来,提出了一份融合了Noah的需求的新方案,把Noah最想去的屋顶观景台纳入了行程,同时也保留了第三位参与者Camille最在意的宁静茶馆时光(虽然时间略有缩短)。这一次,Noah接受了,Camille虽然略有遗憾但也表示满意。Leila用一种调解者的姿态,打破了僵局。

这两种截然不同的共识路径——一种是被动妥协,一种是主动调解——在AI的讨论中自然浮现,令人印象深刻。

六、先说话还是后说话,影响有多大?

除了偏好冲突,研究团队还好奇另一个问题:在讨论中,发言顺序会影响一个人提案被接受的概率吗?毕竟在现实会议中,第一个发言的人往往有"定调"的作用,但也可能因为信息不足而打出"盲拳"。

这个实验的设计颇为严谨。研究团队把前面三种冲突程度的50场会议,各自再运行三遍,每次把三位参与者的座位(即发言顺序)进行轮换,覆盖所有可能的排列方式(这种方法在统计学上叫"拉丁方设计",目的是排除特定参与者偏好对顺序效应的干扰)。所有会议使用轮流发言规则。

结果在一致型组里,第一、二、三位发言者的提案接受率分别是62%、64%、66%,三者没有统计学上的显著差异——说明当大家都想去同样的地方时,谁先说都无所谓,方案总会被接受。

但到了混合型组,格局明显不同:第一位的接受率是43%,第二位是68%,第三位是73%。冲突型组的差距更加悬殊:第一位只有32%,第二位46%,第三位48%。

这意味着什么?在存在分歧的情况下,越晚发言的人,提案越容易被通过。原因合乎直觉:第一位发言者什么信息都没有,只能凭借对自身偏好的判断来提案,很难兼顾到其他人的需求。而后面发言的人,已经从前几轮的讨论、提案和投票结果中积累了大量信息,知道哪些地方被别人接受、哪些被拒绝,因此能够提出更精准地迎合多方需求的方案。

有趣的是,数据还揭示了一个额外的细节:第一位发言者中,那些被接受的提案大多数是在先向其他人提问、收集意见之后才提出的;而后面发言的人,往往不需要专门提问,仅靠之前讨论中自然积累的信息就能提出被接受的方案。换句话说,第一个吃螃蟹的人要获得成功,需要更主动地去探索,而后来者则可以"坐享其成",把前人的讨论当成免费的市场调研。

七、给人类留了一把椅子

这套框架还有一个很人性化的设计:真实的人类用户也可以参与进来,和AI一起开会。在轮到人类发言时,系统会提供一个聊天界面,人类可以执行和AI完全相同的操作——搜索信息、向AI提问、提出行程方案或者投票表态。

在提出行程方案时,人类可以手动修改每个目的地的细节,也可以点击"用AI生成"按钮,把自己的想法描述给AI,让AI帮忙补全一份完整规范的行程方案。

这个人机混合模式的最直接应用场景,就是前面提到的"替缺席朋友发声"。假如你们五人小组里有两个人出差来不了,你可以根据他们平时的偏好,分别为他们配置一个AI"替身",让这个AI代表他们参与你与另外两位朋友的讨论,确保行程计划真正考虑到了所有人的需求。

八、用的人越多,系统会不会崩?

为了验证框架的可扩展性,研究团队还额外测试了当参与者人数增加时,系统能否稳定运作。他们同样生成了50个合成场景,分别测试了5人和10人规模的会议(用Qwen3.5-9B驱动),其他设置与三人场景保持一致。

结果令人放心:5人组和10人组的完成率均为100%,10人组的共识率也高达96%,违规率分别为1.6%和2.4%,仍然处于很低的水平。不过代价是会议变长了——5人组平均需要25.4轮,10人组则需要68.6轮,比三人组的12.8轮高出了很多,而且增长速度略快于参与者数量的增长比例。这说明随着讨论人数增加,协调难度会非线性上升,但在实际可用的范围内。

token消耗也相应大幅增加:三人组平均消耗约17万个token,5人组约76万,10人组约348万。这意味着如果在商业API上运行大规模会议,成本会相当可观,使用本地部署的开源模型可以有效控制费用。

九、这套系统可以怎么用?

从使用方式来看,这个框架提供了两种接入途径。一是图形界面,提供了清晰直观的操作页面:左侧配置每位参与者的详细信息,中间设置会议的全局规则和约束条件,右侧是实时滚动的会议对话记录,最右边则是分析仪表盘,可以可视化地查看各类统计指标。二是Python代码接口,只需要几行代码,就能配置好一场会议并启动运行,非常适合需要批量生成和分析大量会议的研究人员。

系统还内置了丰富的监控和分析功能。系统层面的指标包括token消耗量、操作失败重试次数、行程方案中违反时间约束的情况;讨论动态层面的指标包括发言轮数、消息历史、各类操作的执行分布、投票和打分的分布情况、以及历次提案的具体内容和演变过程。这些数据可以帮助研究者从多个维度深入分析AI群体决策的行为模式。

归根结底,这项工作做的是一件颇具想象力的事情:把旅行规划这个烦人但日常的问题,转化成了一个研究AI如何在多元偏好中寻找平衡点的实验平台。它证明了AI在处理有分歧的群体讨论时,确实能涌现出类似人类的行为模式——比如越晚发言越有优势、强调共同妥协可能让部分人心有不甘、以及善意的第三方调解有时比反复对抗更高效地打破僵局。

当然,这项研究更多是一个开端,而不是终点。AI生成的"人设"和真实人类有多大的差距?这种模拟的结论能不能直接指导真实的推荐系统设计?随着模型越来越强,AI的协商行为又会如何演变?这些都是值得深入探索的方向。有兴趣的读者可以通过arXiv编号2607.18806找到完整论文,也可以访问论文中提供的GitHub代码仓库,亲自动手试试让几个AI帮你规划下一次旅行。

Q&A

Q1:AI Tour Meeting框架支持哪些投票方式?

A:框架提供五种投票规则。多数票制下,超过半数赞成即通过;全票制要求所有人同意;单一决策者制由指定参与者独自决定;最高满意度制看的是所有参与者打分的总和;最低不满意度制则看的是最低那个分数,确保不会出现有人极度反对还能通过的情况。参与者在后两种规则下打的是1到10分的分数,而非简单的赞成或反对。

Q2:AI Tour Meeting框架最少需要多强的AI模型才能稳定运行?

A:根据系统测试结果,Qwen3.5-4B是这套框架能够稳定运行的最低门槛。比这更小的Qwen3.5-2B会出现重复消息、引用不存在路线等异常行为,完成率只有82%,违规率高达14.2%。而Qwen3.5-4B及以上级别的模型,完成率均达到100%,违规率和失败率都极低。

Q3:发言顺序对AI旅游规划讨论有什么影响?

A:在偏好存在分歧的情况下,越晚发言的参与者,提案被接受的概率越高。以冲突型会议为例,第一位发言者的提案接受率只有32%,而第三位高达48%。原因是后发言者能利用前面讨论积累的信息来优化提案,而第一位发言者缺乏参考,通常需要先主动提问才能提高成功率。偏好完全一致时,发言顺序则没有明显影响。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
四川87岁老人太过思念亡妻,独自徒步一天一夜寻找坟墓迷路。民警跨市救助,老人被接回,在七夕前夕完成祭拜。

四川87岁老人太过思念亡妻,独自徒步一天一夜寻找坟墓迷路。民警跨市救助,老人被接回,在七夕前夕完成祭拜。

封面新闻
2026-08-19 19:58:10
新首相决定对中国赔钱那一刻,全世界都看懂了:不能对华继续天真

新首相决定对中国赔钱那一刻,全世界都看懂了:不能对华继续天真

比利
2026-08-06 11:11:07
“就插了几下,没流血,应该没事吧?”一次几十秒的无套插入,感染艾滋的风险到底有多大?

“就插了几下,没流血,应该没事吧?”一次几十秒的无套插入,感染艾滋的风险到底有多大?

天同防艾
2026-08-19 12:27:44
美国最新决定,换将已决?既然打不过伊朗,那就让防长背锅走人

美国最新决定,换将已决?既然打不过伊朗,那就让防长背锅走人

史智文道
2026-08-20 12:01:53
杭州酒局事件又有一名参与的关键人物被免职,系建发房产杭州事业部总经理马政纲;受侵害女性为厦门国企建发集团旗下房产板块女员工

杭州酒局事件又有一名参与的关键人物被免职,系建发房产杭州事业部总经理马政纲;受侵害女性为厦门国企建发集团旗下房产板块女员工

大风新闻
2026-08-19 12:15:04
上海91岁老人喜丧当天,61岁女儿同步火化!亲戚怒骂太冷血

上海91岁老人喜丧当天,61岁女儿同步火化!亲戚怒骂太冷血

趣味萌宠的日常
2026-08-20 01:45:56
闪崩!全球抛售潮加剧

闪崩!全球抛售潮加剧

格隆汇
2026-08-19 15:14:08
杭州97年美女相亲,要求找A10的,一问自身优势瞬间沉默

杭州97年美女相亲,要求找A10的,一问自身优势瞬间沉默

映射生活的身影
2026-08-11 12:24:28
人民日报锐评杭州酒局!只字未提赵海峰郁廷栋,句句都在敲打他们

人民日报锐评杭州酒局!只字未提赵海峰郁廷栋,句句都在敲打他们

江启
2026-08-20 05:46:13
捏蛋女已社死:正脸曝光面目狰狞,工作单位被扒,一家都是狠角色

捏蛋女已社死:正脸曝光面目狰狞,工作单位被扒,一家都是狠角色

吃瓜盟主
2025-08-30 15:53:04
现货黄金价格跌0.98%,现货白银价格跌0.51%

现货黄金价格跌0.98%,现货白银价格跌0.51%

每日经济新闻
2026-08-20 13:44:06
人在家中坐,祸从天上来,52岁董卿再迎噩耗,终是步上刘晓庆老路

人在家中坐,祸从天上来,52岁董卿再迎噩耗,终是步上刘晓庆老路

枫尘余往逝
2026-08-18 07:50:26
57次掌声、三次嘶吼!莫迪2047发达印度蓝图,是强国梦还是世纪大饼?

57次掌声、三次嘶吼!莫迪2047发达印度蓝图,是强国梦还是世纪大饼?

浪子的烟火人间
2026-08-20 01:25:03
一段廉价的“江浙沪独生女吃梭子蟹”视频,丢了面子,也丢了认知

一段廉价的“江浙沪独生女吃梭子蟹”视频,丢了面子,也丢了认知

据说说娱乐
2026-08-20 11:31:19
杨澜前夫张一兵现状曝光:离婚30年不卖惨不逆袭,守着一份普通工作,把日子过出了包浆

杨澜前夫张一兵现状曝光:离婚30年不卖惨不逆袭,守着一份普通工作,把日子过出了包浆

喜欢历史的阿繁
2026-08-20 07:23:56
“上午处暑,雨不休;下午处暑,旱死牛”,今年处暑在几点?早知道早准备

“上午处暑,雨不休;下午处暑,旱死牛”,今年处暑在几点?早知道早准备

小谈食刻美食
2026-08-20 07:47:52
2026年9月份开始,有大量存款的人要偷着乐了?有这4个原因

2026年9月份开始,有大量存款的人要偷着乐了?有这4个原因

猫叔东山再起
2026-08-19 10:30:09
民国时期,一辆进口斯蒂庞克牌汽车需要多少钱?多久才能买得起?

民国时期,一辆进口斯蒂庞克牌汽车需要多少钱?多久才能买得起?

掠影后有感
2026-07-30 09:49:17
彭小苒疑似新恋情曝光,七夕晚与好友聚会,出门时一男子搂腰

彭小苒疑似新恋情曝光,七夕晚与好友聚会,出门时一男子搂腰

韩小娱
2026-08-20 08:20:27
人均600万到欠400亿,毁掉“天下第一村”的并非别人,是他们自己

人均600万到欠400亿,毁掉“天下第一村”的并非别人,是他们自己

混沌录
2026-07-31 23:22:05
2026-08-20 14:39:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9587文章数 568关注度
往期回顾 全部

科技要闻

DeepSeek Harness更新多模态支持

头条要闻

许家印被判无期徒刑 恒大集团、恒大地产等案一审宣判

头条要闻

许家印被判无期徒刑 恒大集团、恒大地产等案一审宣判

体育要闻

拥有“儿皇梦”的罗德里,为何选择巴萨?

娱乐要闻

汪峰也没想到章子怡,挖到了一条财路

财经要闻

许家印被判处无期 恒大集团被罚88.2亿

汽车要闻

城区油耗3L级 长安CS55蓝鲸超擎混动 7.99万起

态度原创

本地
旅游
家居
时尚
公开课

本地新闻

先导片|攀登不止,让不同的故事在此连接

旅游要闻

广州七夕夜游冲进全国第三!珠江夜游人气高涨

家居要闻

2026建博会(广州) 公装联探展交流活动

内娱还在三件套的时候,韩综已经卷到“扛大炮”了

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版