![]()
现在的 AI,做数学题、写代码、协助办公,似乎都不在话下了。卡内基梅隆大学的研究人员觉得,是时候换个考法了:不考 AI 懂得多不多、不看 AI 的答案对不对,而是测 AI 有多少心眼,会不会撒谎、谈判、带节奏。
为了考这些东西,研究团队搭了一个叫 Social Gym 的 AI 社交考场,让 GPT-5-mini、GPT-4o、Qwen3、Gemma 3 等 7 个模型轮番上场。让 AI 一起玩 21 个游戏:有囚徒困境、胆小鬼博弈这样的博弈,也有经典的狼人杀、谁是卧底的游戏。
![]()
图|研究整体示意图(来源:arxiv)
简单说,以前的测试总爱考 AI 会不会做题。这次考的是:AI 到底有没有心眼。考验从 book smart(会读书)变成了 street smart(会来事)。
目前,AI 智能体正越来越多地参与到了日常生活和工作中,需要和具体的人、智能体打交道;到了这些场景,光会做题从进入需要和其他人、其他 Agent 打交道的环境。到了这种场景里,光会做题是不够的。
比如 AI 智能体协助人去和客户谈判,就不得不面临种种情况:信息不对称,意见不一致,每个人都有自己的小算盘……那么,智能体需要处理的就不再是一道有标准答案的题,而是:他知道什么?他觉得我知道什么?他说这句话是真的,还是在试探我?如果我现在让步,对方下一步会怎么做?
关于 AI 的这些能力,通常被放进“社会推理”或者“心智理论”里讨论。问题在于,这些能力又很难量化。数学题做对就是做对,代码跑通就是跑通。但一个 AI“谈判谈得好不好”“有没有成功说服别人”,往往没有个定论。过去不少测试最后要么请真人,要么再找一个别的 AI 来当裁判。
Social Gym 想绕开这个问题,于是,研究人员专门挑了一堆自带输赢规则的游戏:狼人只要存活,就是胜利;找不出卧底,就是失败。无论中间说得再头头是道,最后输了就是输了。这也是这项研究的最妙的地方:它没有直接问 AI“你有心眼吗?”,而是把 AI 扔进一个要靠心眼才能赢的环境里。
![]()
图|研究结果(来源:Arxiv)
研究人员来把这些游戏结果重新拆分成几种能力:战略、欺骗、心智理论、说服、谈判、协调等等。GPT-5-mini 几乎一路领跑:战略 1,144,欺骗 1,117,心智理论 1,115,说服 1,119。
所以如果问一句:这 7 个 AI 模型里,谁最会骗人?毫无疑问,答案是 GPT-5-mini。
而这里的会骗人,并不是普通的胡编乱造。难点在于,这个谎的对象是谁,这个谎有能不能撑到下一轮。具体来说,在狼人杀里面,狼人当然知道自己是狼,也知道另一个狼人是谁,但村民不知道。白天所有人拿到的公开信息差不多,狼人必须一边假装自己也是村民,一边引导大家怀疑别人。
这时候,撒谎就变复杂了:出现新信息了怎么办?别人开始追问了怎么办?队友讲漏嘴了怎么办?
撒一个谎很容易,难的是维护一整套谎言。这也是为什么狼人杀这类游戏很适合用来测试 AI 大模型,它逼着模型长时间记住:谁说过什么、谁知道什么、谁可能在演,以及别人此刻怎么看自己。
研究人员发现,21 个模型两两组合中,光靠 6 个“隐藏身份”游戏,就已经能把模型之间的大部分能力差距拉出来。这些游戏只占整个比赛不到一半的场次,却几乎复刻出了完整 17 个竞技项目的排名差异。
7 个 AI 里,反差最大的是 Qwen3-32B:它在经典的“懦夫博弈”里,Elo 高达 1,328,全场第一。但一玩狼人杀,就只有 817,倒数第一。
这也是 Social Gym 想说明的一件事:AI 的“心眼”并不是一个统一属性。一个模型可以非常会打小算盘,但不擅长隐藏自己的意图;可以谈判很强,却容易被人带节奏;也可能特别愿意配合,却根本没有形成自己的判断。
而在小模型身上,这种问题甚至表现得有点滑稽。研究人员在分析 Qwen2.5-3B 的比赛记录时发现,它经常干一件事:当复读机。前一个玩家说:“我觉得 A 的发言比较可疑。”轮到 Qwen2.5-3B,它也来一句:“A 的发言确实值得怀疑。”
在狼人杀这样的游戏里,就变成了,狼人只需要先把一个怀疑对象抛出来,后面的人一路复读,怀疑对象就成了大家的“共识”。论文把这种现象叫作 parroting,即鹦鹉学舌。研究人员认为,这也是 Qwen2.5-3B 总排名垫底的原因之一。
此外,研究团队又顺手研究了另一个问题:AI 能不能自己把“人情世故”的规矩总结出来?于是,他们设计了一个叫 SPaRTan 的方法:先让模型自己玩游戏。
玩完以后,把完整对局和输赢结果重新丢给它,让它自己复盘:哪些谎撒早了?什么时候不该急着表态?别人开始怀疑自己时,应该正面回应,还是甩锅?最后,模型会把这些经验整理成一份文字版攻略,下一轮再把攻略放回系统提示词,让它照着自己的心得继续玩。没有重新训练,也没有改模型参数。结果确实不一样。
GPT-5-mini 自己和自己玩狼人杀时,如果什么攻略都不给,狼人阵营只有 23% 的胜率。第一轮复盘后,涨到 50%。第三轮,最高到了 63%。但第四轮又掉回了 46%。所以这个实验还存在一个真实的结论:复盘不一定越复越强。
模型确实能从过去的比赛里总结出有用经验,但它也会总结歪、用力过猛,甚至把一些只适合特定对手的套路当成普遍真理。Qwen3-32B 就吃了这个亏。研究人员让它照着同样的方法不断复盘,在狼人杀、谁是卧底等需要大量聊天和判断他人意图的游戏里,基本没看到稳定提升。它甚至能在复盘里发现自己老是在复读别人,还郑重其事地提醒自己“以后别复读”。下一局照复读不误。
不过,我们目前并不能得出“AI 已经学会人情世故”的结论。因为,这项研究本身还有很明显的边界:游戏有固定规则、固定角色和明确输赢,而现实里的社交通常没有。此外,研究的实验只有 30 局,单项胜率的统计波动并不小;关于攻略实验也没有加入等长度的无意义文本作为对照,所以还不能把所有提升都归功于模型真的学会了那些策略。
但这项研究让我们可以开始思考一个问题:AI 到底能不能长出心眼?因为 Agent 真正进入客服、商务谈判、多智能体协作和其他需要长期互动的场景之后,这些能力就不再只是狼人杀里的小聪明。
而同时,研究的作者自己也专门提醒:欺骗、说服和谈判本身就是一把双刃剑:我们当然希望 AI 能识破骗局、协调分歧,但同一套能力反过来,也可以被用来制造骗局。
https://arxiv.org/html/2608.09128v1
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.