网易首页 > 网易号 > 正文 申请入驻

爱丁堡团队:人类如何看待AI博弈对手?

0
分享至

这项由爱丁堡大学经济学院的Darija Barak和Miguel Costa-Gomes教授共同完成的研究发表于2025年5月16日,论文题为《人类期望大语言模型(LLM)对手在战略博弈中表现出理性和合作》(Humans expect rationality and cooperation from LLM opponents in strategic games),发布于arXiv预印本平台(arXiv:2505.11011v1)。

研究背景:当AI成为我们博弈对手

想象一下,你正在玩一个猜数字的游戏。现在告诉你,你的对手不是人类,而是ChatGPT或Claude这样的人工智能。你会改变你的策略吗?会不会对AI产生特殊的期待?这正是爱丁堡大学研究团队想要探索的问题。

随着大语言模型(LLM)的迅速发展,它们已经从简单的聊天机器人进化为能够参与我们社会和经济活动的智能体。很快,我们将不可避免地与这些AI智能体在复杂的交互场景中共处,这些场景以前完全由人类主导。不难想象,在不久的将来,人类将在由数百甚至数千个AI智能体主导的环境中互动。这种快速变化带来了一个关键的研究前沿:理解人类如何在既有人类也有AI智能体的战略环境中调整自己的行为。

虽然已经有研究探索了LLM在标准经济博弈和更复杂环境中的行为表现,但人类与LLM的战略互动在很大程度上仍然未被探索。目前只有Engel等人的工作研究了人类如何在两人囚徒困境中与LLM互动。但一个重要问题仍未解决:当面对多个LLM对手且没有占优策略存在时,人类会如何行为?

研究方法:精心设计的实验揭示人类对AI的期望

研究团队选择了一个经典的p-美丽竞赛游戏作为实验工具。这是一个用于研究战略推理的常用游戏,常被视为金融市场的简化模型。该游戏要求参与者选择0到100之间的一个数字,离目标数字(所有参与者选择的平均数乘以一个系数p)最近的人获胜。

想象一下这个游戏:如果p=2/3,而所有人平均选择了30,那么目标数字就是20(30×2/3)。谁选的数字最接近20,谁就获胜。这个游戏的关键在于,你需要预测其他人会选什么数字,然后据此制定自己的策略。

研究团队的创新之处在于使用了一个组内设计的实验方法,允许他们比较同一个人在与其他人类实验参与者互动或与LLM(ChatGPT 3.5和Claude v2)对抗时的行为差异。他们特别关注那些人类与多个对手互动且没有任何参与者存在占优策略的情境。这意味着,为了选择策略,参与者必须形成关于对手行动的信念,这让研究者能够调查人类是否对LLM和其他人类有不同的看法。

研究还利用了两名玩家版本的p-美丽竞赛,这种版本下,能够找到(弱)占优策略的参与者被认为具有高战略推理能力。基于这种推理能力将受试者分成不同子样本,进一步研究人类在面对LLM而非人类时行为差异的异质性,并检验哪些信念驱动了这些行为转变。

实验设计:如何对比人类与AI的互动差异

研究团队在实验室中招募了72名受试者,他们都是来自爱丁堡大学的学生,包括本科生和研究生,平均年龄为22.6岁。实验过程中,参与者需要完成一系列任务:

首先,参与者完成了6个版本的p-美丽竞赛游戏。基础版本是3人美丽竞赛,p=2/3,获胜者获得3英镑奖励,如果出现平局,奖金平分。此外还有两个相关任务:两人p-美丽竞赛,参数p分别为2/3和1/2。

接下来,研究者让参与者预测其他实验参与者在游戏中的选择。这项任务类似于让参与者分配17个"代币"(代表同一场会话中的其他17名参与者)到20个等大小的"箱子"中,这些箱子代表了不同范围的数字选择。

然后是关键部分:参与者被要求在3人p-美丽竞赛中与两个LLM(ChatGPT和Claude)对战。这个任务与之前的人类对战任务相似,但参与者被明确告知他们的对手是由OpenAI开发的ChatGPT和由Anthropic开发的Claude。值得注意的是,研究者用相同的提示词询问了这两个LLM,它们都选择了50作为自己在游戏中的猜测。但参与者在做出选择时并不知道LLM的实际选择,只有在实验结束时才能了解。

最后,参与者还完成了一项任务,该任务中对手的选择是已知的。这让研究者能够检查参与者是否能够对已知的对手选择做出最佳响应。

整个实验过程中,参与者可以使用屏幕上的计算器,并根据在各部分的表现获得奖励。平均而言,参与者获得了17英镑的报酬(包括5英镑的出场费)。

研究发现:人类确实对AI抱有特殊期望

通过仔细分析实验数据,研究团队发现了几个重要结果:

首先,人类确实在战略上区别对待LLM和人类对手。 当与LLM对战时,参与者选择的数字显著低于与人类对战时(平均数分别为23和29)。有趣的是,50%的参与者在与LLM对战时选择了比与人类对战时更小的数字,平均减少了18.2点。相比之下,只有37.7%的参与者在与LLM对战时选择了较大的数字,平均增加仅为7.3点。这表明大多数参与者确实调整了他们的策略,且调整幅度相当显著。

其次,选择零的频率是关键差异。 在与人类对战的3人p-美丽竞赛中,只有4.2%的参与者选择了零,而在与LLM对战时,这一比例上升到了15.3%。更有趣的是,这些选择零的参与者中,36.4%来自那些表现出高战略推理能力的参与者,而这些高能力参与者仅占总样本的16.7%。

再者,高战略推理能力的参与者更容易对LLM采取不同策略。 研究者通过一系列标准确定了具有高战略推理能力的参与者。结果显示,35.7%的高能力参与者在与LLM对战时选择了零,相比之下,其余参与者中只有10%这样做。这表明,那些具有更强战略思维能力的人更可能预期LLM会表现出更接近均衡的行为。

最后,参与者的选择动机揭示了对LLM的复杂预期。 当被问及为何在与LLM对战时选择零时,6位参与者提到了他们预期LLM能够通过推理到达零这个选择。令人惊讶的是,另外4位参与者提到了合作性,他们预期LLM会选择零,因为在成功合作的情况下,这将确保多位获胜者平分奖金。这一发现特别值得注意,因为p-美丽竞赛本质上是一个非合作性的环境,协调行动并不会增加个人或集体利益。

研究意义:人机互动的未来设计

这项研究为理解人类如何在战略环境中与LLM互动提供了基础性见解。它不仅揭示了人类确实区别对待LLM与人类对手,还开始揭示谁会这样做以及为什么。

对于机制设计者来说,这些发现具有重要意义。当设计混合人类-LLM互动场景的机制时,我们必须考虑各种类型代理的异质性及其对对手的信念。仅基于纯人类环境的人类行为假设可能在有(众多)LLM代理参与的环境中失效。研究者需要仔细调查这些假设的有效性,并确保未来的机制对LLM"意图"和推理能力的各种信念具有鲁棒性。

同时,也许可以利用人们对LLM复杂性或合作性的认知来引导人类行为。虽然本文中的机制设计含义是基于p-美丽竞赛中人类行为的观察,但它们突显了为人类-AI环境设计机制的更广泛挑战。需要进一步研究来确定这些发现是否适用于其他环境,如(反)协调或谈判博弈。

未来展望:扩展研究边界

未来的研究应该显著扩大范围。应该致力于在更广泛的战略环境中探索人类-LLM互动,如(反)协调、公共物品和谈判博弈,以及在有学习机会的动态环境中进行研究。重要的是,研究应该测试与除了我们使用的两个版本之外的各种LLM的互动,包括更新的架构和为战略博弈校准的模型。

研究人数量的扩展效应,可能扩展到数百甚至数千个LLM代理,以及理解人类行为对不同LLM提示策略的敏感性也将是有价值的研究方向。

总之,这项研究向我们展示了一个重要事实:在战略博弈中,人类确实会对LLM持有特殊的期望——无论是期望它们更理性,还是更具合作性。随着AI日益融入我们的社会和经济生活,理解这些期望如何塑造我们的行为将变得越来越重要。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
海港1-1英博,斯坦丘点射,李新翔绝平,德尔加多替补席染红

海港1-1英博,斯坦丘点射,李新翔绝平,德尔加多替补席染红

懂球帝
2026-08-19 21:41:22
后果很严重!清华毕业的赵海峰只有3个结局,网友发帖预测引发争议:5亿都摆不平了

后果很严重!清华毕业的赵海峰只有3个结局,网友发帖预测引发争议:5亿都摆不平了

火山詩话
2026-08-19 05:47:34
“弟弟才是唐时达,哥哥在撒谎”:弟弟高中同学发视频晒证据,为弟弟发声

“弟弟才是唐时达,哥哥在撒谎”:弟弟高中同学发视频晒证据,为弟弟发声

江山挥笔
2026-08-19 21:51:35
爽了!3次拒绝!200万变1200万!

爽了!3次拒绝!200万变1200万!

柚子说球
2026-08-19 21:05:08
杭州“酒局事件”,真正细思极恐的地方没人敢说

杭州“酒局事件”,真正细思极恐的地方没人敢说

清书先生
2026-08-19 16:12:29
郭德纲曾经在《欢乐喜剧人》对沈腾说:“赐名沈云腾”沈腾没接话

郭德纲曾经在《欢乐喜剧人》对沈腾说:“赐名沈云腾”沈腾没接话

西楼知趣杂谈
2026-08-19 21:16:19
信号强烈!今天A股上演的这出大戏,让人有点目瞪口呆

信号强烈!今天A股上演的这出大戏,让人有点目瞪口呆

识局Insight
2026-08-19 17:55:57
知情人曝光赵海峰酒局上伤害女性细节!警方已介入,公司紧急换人

知情人曝光赵海峰酒局上伤害女性细节!警方已介入,公司紧急换人

社会日日鲜
2026-08-19 09:05:12
实名举报反转?哥哥唐时达法庭亮微信记录,指控弟弟唐一达冒名案中涉嫌行贿

实名举报反转?哥哥唐时达法庭亮微信记录,指控弟弟唐一达冒名案中涉嫌行贿

网易新闻出品
2026-08-18 19:01:05
四川升学宴女儿墙倒塌后续:主家是低保户,孩子考500多分,本不想办,但周围人都劝

四川升学宴女儿墙倒塌后续:主家是低保户,孩子考500多分,本不想办,但周围人都劝

东东趣谈
2026-08-19 14:56:20
特种部队俘获30名俄军!俄媒大肆报道,暗示乌军第3军团司令已死

特种部队俘获30名俄军!俄媒大肆报道,暗示乌军第3军团司令已死

鹰眼Defence
2026-08-19 17:41:00
把“靖国神社”改称“战犯神社”的同时,“日本天皇”这个称谓也应该调整了

把“靖国神社”改称“战犯神社”的同时,“日本天皇”这个称谓也应该调整了

青陆
2026-08-19 13:31:11
放郭德纲一马,等于告诉世界:我们将继续开放,我们将继续拥抱世界

放郭德纲一马,等于告诉世界:我们将继续开放,我们将继续拥抱世界

细雨中的呼喊
2026-08-18 20:47:03
前上海首富周正毅这次真的“凉”了!全平台账号消失,曝重要原因

前上海首富周正毅这次真的“凉”了!全平台账号消失,曝重要原因

裕丰娱间说
2026-08-19 15:55:33
乌克兰向全球发出严厉通告:只要朝鲜导弹部队踏入俄境,乌军将立即展开打击,将其彻底摧毁。这一罕见强硬表态迅速引发各方关注

乌克兰向全球发出严厉通告:只要朝鲜导弹部队踏入俄境,乌军将立即展开打击,将其彻底摧毁。这一罕见强硬表态迅速引发各方关注

人生录
2026-08-18 00:05:08
办升学宴5死17伤,村民:他们家是低保户,为庆祝孩子考上大学,喜事变丧事

办升学宴5死17伤,村民:他们家是低保户,为庆祝孩子考上大学,喜事变丧事

汉史趣闻
2026-08-19 14:39:00
7月经济数据出来,说是结构性塌方,也已经比较隐晦了。

7月经济数据出来,说是结构性塌方,也已经比较隐晦了。

流苏晚晴
2026-08-19 22:31:00
两个小女孩买三张硬座票,无座乘客想坐,商量无果找来列车员调解,列车员:座位是她们的,跟我说没用

两个小女孩买三张硬座票,无座乘客想坐,商量无果找来列车员调解,列车员:座位是她们的,跟我说没用

潇湘晨报
2026-08-19 20:38:28
传了多年身世流言,姜武终于发声:我和姜文是同父同母亲兄弟

传了多年身世流言,姜武终于发声:我和姜文是同父同母亲兄弟

乡野小珥
2026-08-19 11:09:41
美国能源部副部长:现在委内瑞拉一半的石油产量,都被美国消化了

美国能源部副部长:现在委内瑞拉一半的石油产量,都被美国消化了

史樍
2026-08-19 16:46:59
2026-08-20 04:48:49
至顶科技 incentive-icons
至顶科技
科技产业媒体与 AI 产业服务机构
21097文章数 49729关注度
往期回顾 全部

科技要闻

宇树的悬念还在后面

头条要闻

升学宴事故致5死17伤 主家亲属:主家发愁怎么赔偿

头条要闻

升学宴事故致5死17伤 主家亲属:主家发愁怎么赔偿

体育要闻

拥有“儿皇梦”的罗德里,为何选择巴萨?

娱乐要闻

章子怡财路遭到质疑,套现3亿冲上热搜

财经要闻

内部反腐,让大疆错过宇树250亿收益?

汽车要闻

小米澎程N70体验 后排空间夸张亦可旋转对坐

态度原创

教育
旅游
本地
健康
游戏

教育要闻

以后小学生聊大模型,可能比我还溜。江苏这波AI通识课,秋季全覆盖

旅游要闻

不止有勐泐大佛寺,曼弄枫大有来头,远古洪水被佛祖引入澜沧江!

本地新闻

先导片|攀登不止,让不同的故事在此连接

这种脊柱侧弯,运动能救!

曝索尼1599元精英手柄将出新款:神秘型号现身

无障碍浏览 进入关怀版