网易首页 > 网易号 > 正文 申请入驻

当伴侣吵架吵到面红耳赤,如果交给AI来"劝架",AI能听懂多少?

0
分享至

来源:市场资讯

(来源:科技行者)


香港理工大学的一群研究者最近做了一件挺较真的事:他们找来174对夫妻和17个家庭做心理咨询访谈的真实录像,一帧一帧地标注,谁在什么时候说了什么话,情绪是什么样,谁对谁有什么看法,咨询师什么时候该开口、该对谁说话、该用什么策略。这套数据集起了个名字叫RESCUE-BENCH,然后拿了十个当下最厉害的大语言模型来做测试。

结果挺有意思:这些AI在"看懂一个人现在什么心情"这件事上表现得不错,但一旦涉及到"这两个人之间到底是什么关系动态""谁在拉扯谁""该先安抚谁"这类问题,统统翻车。

这篇论文的意义,可能比它听起来的要大。因为过去几乎所有的AI情感陪伴系统,都默认了一个前提:一个用户,一个AI,一对一聊天。可现实生活里,大部分让人心力交瘁的情绪困境,恰恰不是一个人的事。

**为什么"一对一安慰"模型解决不了真正的痛点**

先说说现在市面上AI情感支持系统都在做什么。

ESConv*:一个由学者构建的经典情感支持对话数据集,场景设定是一个寻求帮助者和一个支持者之间的一对一聊天,是目前大多数AI情感支持研究的基础

这类系统的逻辑很清楚:用户倾诉,AI理解情绪,AI给出安慰或建议,循环往复,目标是让这一个人感觉好一点。

问题是,当研究者们想把这套逻辑扩展到"多人场景"时,他们做的事情往往是简单粗暴的复制粘贴:同一套逻辑,套用在每个参与者身上,各自安慰各自的,互相之间的关系被完全无视。

这就好比你去调解两口子吵架,你分别把两人叫到不同房间,各自听各自倒苦水,分别安慰完就完事,从没让他们俩坐下来一起谈过彼此之间到底发生了什么。这种"调解"有用吗?

多半没用,因为矛盾的根源根本不在某一个人的情绪里,而在两人之间的互动模式里。如果一方总是追着要解释,另一方总是回避退缩,你单独安慰追的那个人"别急",单独安慰躲的那个人"别怕",这两人回到一起该怎么互动还是怎么互动,问题压根没触碰到。

论文里提到两个心理学概念来解释这个逻辑:

木桶效应*:一个群体的整体状态,往往取决于其中最脆弱、最痛苦的那个成员有没有被照顾好,而不是所有人平均水平如何

涟漪效应*:一个人的情绪和压力,会像水波一样在关系网络里扩散开去,影响到其他人

这两个概念放在一起看,意思很直白:如果你的AI系统只顾着让每个人"平均感觉好一点",却没注意到那个最痛苦的人到底有没有被真正接住,也没注意到情绪是怎么在人和人之间传染的,那这个系统从设计逻辑上就没抓住重点。

**关系感知型情感支持,到底要多做点什么**

论文提出了一个新任务,叫"关系感知情感支持对话"。听起来抽象,拆开来看其实很具体。

传统的情感支持系统,只需要搞明白一件事:这个人现在什么感受,强度多大。

而关系感知系统,除了要搞懂个人情绪,还得额外搞懂三件事:这个人对另一个人是什么态度和立场(比如"我觉得他从来没把我当回事");整个群体现在处于一种什么样的互动模式(比如"一个人在追,另一个人在躲",或者"两个人在互相攻击");基于这些理解,该在什么时候介入、该重点关照谁、该用什么策略。

研究者把这套复杂的判断拆成了六个具体的评测任务,分成两大类。

第一类叫"关系理解",包括情绪识别、观点预测、关系模式预测三项。第二类叫"关系敏感型支持",包括介入时机预测、支持对象预测、支持策略预测三项。

**为什么这六个任务缺一不可**

情绪识别*:判断某个说话人此刻内心的情绪状态和强度,这是传统ESC任务里就有的能力

观点预测*:判断一个人对另一个人的看法和态度,比如"她觉得他从来不听她说话"

关系模式预测*:判断当前这段对话整体处于什么样的互动循环里,比如追逐-回避、互相攻击、修复中的软化,等等

介入时机预测*:判断咨询师此刻该不该开口说话

支持对象预测*:判断这次介入应该主要针对谁,是某一个人、某两个人的冲突,还是整个家庭

支持策略预测*:判断针对选定的对象,该用什么样的具体干预方式

这六个任务加起来,才勉强够得上"理解一段复杂人际关系,并且做出恰当回应"这件事的完整链条。

传统的一对一情感支持研究,基本只涉及情绪识别和支持策略这两项,中间那四项——观点预测、关系模式预测、介入时机、支持对象——全都是空白。

这就像一个只会看体温计的医生,遇到复杂病人时突然发现,光看体温根本不够,还得看血压、心率、影像、化验单,才能判断到底该给哪个器官动手术,先动哪个,怎么动。

**真实素材从哪来:夫妻和家庭访谈录像**

数据从哪里来这件事,研究者处理得挺实在。他们没有用剧本演出来的对话,也没有让AI自己生成模拟场景,而是直接找了两档真实的纪实类访谈节目:一档是couple therapy(夫妻咨询),一档是family therapy(家庭咨询)。

他们手动把这些视频切成一个个独立的访谈片段,过滤掉时长不足两分钟的片段(太短的片段往往缺乏足够的关系背景),最终留下174个夫妻样本和17个家庭样本,总共标注了7079个对话轮次,视频总时长超过1064分钟。

为了保证标注质量,他们先用一个多模态大模型Gemini-3.1-Pro对每段视频做预标注,参考视频画面和字幕内容,生成结构化的标注草稿。然后请了三位博士级别的标注员,搭建了一套在线核查系统,逐条比对视频原始画面,修正错误标注,剔除识别错误严重、说话人对不上、或者证据不足的片段。

这个流程听起来繁琐,但你想想,如果直接用AI预标注结果不加人工核查,那这个基准数据集的可信度会大打折扣。就好比你要建一个法律案例库,不能让实习生随便翻翻案卷就写摘要,必须有资深律师逐条核实,否则整个案例库的权威性就没了根基。

标注的维度也做得很细,论文里列了六个结构化字段:时间和实体信息(谁在什么时候说话、对谁说)、语言内容(说了什么、什么类型的表达)、个体线索(语气、姿态、表情、内在情绪)、关系立场(互动行为、对他人的观点态度)、咨询师策略(用了什么支持手段)、关系模式(当前处于什么循环状态)。

**关系不是静止的,它会转来转去**

论文里做了一个挺扎实的分析,专门看关系模式是怎么随时间变化的。他们计算了一个转移矩阵,统计"当前处于某种关系状态"之后,"下一步最可能转向哪种状态"。

结果发现,关系变化是高度非线性的。

追逐-回避模式*:一方不断寻求联结、解释、回应,另一方却回避、缩小问题、转移话题或干脆闭嘴,这是一种典型的负性互动循环

攻击-攻击模式*:双方都在互相指责、批评、防御或反击,谁都不退让

修复性软化*:原本剑拔弩张的互动开始松动,双方语气变软,开始表达脆弱、道歉、承认伤害

数据显示,像"攻击-攻击"或者"追逐-回避"这种负面循环,通常不会一步跳到"稳定和谐",中间往往要经过"修复性软化"这个过渡状态。而"追逐-回避"这个模式非常顽固,即便暂时进入了"双方都沉默"或者"关系有所修复"的阶段,过一会儿又会重新冒出来,像一个反复发作的老毛病。

这个发现直接戳中了一个关键问题:如果一个AI系统只会给关系贴一个静态标签("这是攻击型关系"),而不会追踪它是怎么随时间演变的,那它其实没有真正理解关系,它只是拍了一张快照。

这就好比天气预报员只会说"今天是晴天",却完全不会预测"这场晴天接下来会不会转阴、会不会下雨"。知道当下状态是一回事,理解动态趋势是另一回事,后者才是真正有用的能力。

**十个大模型跑分,结果分裂得很明显**

研究者拿了十个代表性的大语言模型来测试,包括Qwen系列、DeepSeek系列、GPT-4o、Kimi K2.5、MiniMax M2.5等,全部用零样本设置跑,也就是不给任何针对性训练,直接看模型的原生能力。

结果呈现出一个很清晰的分裂:凡是依赖"局部线索"的任务,模型表现相对不错;凡是需要"关系推理"的任务,模型普遍翻车。

具体数字是这样的:介入时机预测任务上,平均F1值达到82.62%,情绪识别任务上,平均评分达到4.05分(满分5分)。这两项都是相对"看一眼当下就能判断"的任务。

但关系模式预测任务上,最好的模型准确率也只有45.60%,平均下来只有40.45%。这意味着接近六成的情况下,AI都判断错了当前的关系状态是什么。

观点预测任务上,虽然文本相似度得分(BERTScore)看起来还行,但语义评判得分明显低于情绪识别(3.58分对4.05分),说明AI能大致说出个"看起来像那么回事"的答案,但真正说准"这个人对另一个人的具体看法是什么",难度要大得多。

支持策略预测更惨,召回率只有31.88%,也就是说,AI推荐的最佳策略,只有大约三分之一的情况下真正命中了标注员认定的正确答案。

**为什么"看懂关系"比"看懂情绪"难这么多**

论文对三个代表性的失败任务做了深入分析,这部分内容特别值得琢磨。

先说关系模式预测。研究者按对话进程把每段对话切成十个时间段,发现准确率并不是随着对话变长而单调下降,而是忽高忽低地波动。

这说明问题的根源不是"上下文太长记不住",而是"关系状态在不停地转变,模型跟不上这种转变的节奏"。进一步的分析显示,不同阶段的关系模式分布本身就在剧烈变化,这意味着模型必须持续更新自己对当下互动结构的理解,而不能靠一次性判断吃老本。

再说观点预测。这里最大的难点在于,人们表达对另一个人的看法时,往往不是直接说出来的。

很多时候,一个人不会直接对伴侣说"我觉得你根本不在乎我",而是转过头去对咨询师抱怨,而且措辞往往是伪装过的。比如一个人内心其实是委屈和受伤,表现出来的却是愤怒和强势——愤怒是表面情绪,委屈才是底层动机。

模型往往只能抓住表层的粗粒度情绪,却抓不住这种"话里有话"的深层归因,结果就是经常把这种伪装误判为字面意思。

这就好比一个刚入行的心理咨询师,听到来访者说"我一点都不在乎他怎么想",很容易信以为真,而一个经验丰富的咨询师会立刻警觉:这句话说得这么用力,是不是恰恰相反?现在的大模型,大多还停留在"刚入行"的水平上。

最后说支持策略预测。这个任务上模型的召回率很低,但MRR(衡量正确答案排名靠前程度的指标)相对高一些,这个组合说明了一件事:AI大致能圈出一个"看起来合理"的候选策略范围,但没法精确地从这个范围里挑出那个最对的答案。

这类似于你去咨询装修方案,设计师能给你列出三种大体靠谱的方向,但没法一眼看出你家的具体情况最适合哪一种。这种"能猜个大概,猜不准具体"的状态,恰恰反映出深层关系推理这件事,比表面的分类判断要难得多。

**标签体系的构建:两套理论撑起整个框架**

这篇论文标注体系的理论支撑,值得单独说一说,因为它没有凭空发明一套标签,而是扎扎实实地对接了心理治疗领域已有的成熟理论。

情绪聚焦疗法*(EFT):一种关注夫妻依恋需求和情绪深层动机的心理治疗方法,强调识别负性互动循环、软化情绪防御、促进情感联结

结构式家庭治疗*(SFT):一种关注家庭结构、边界、层级和联盟关系的心理治疗方法,强调通过调整家庭内部结构来解决问题

夫妻场景的标签设计,主要围绕情绪聚焦疗法展开,像"追逐-回避""攻击-攻击""修复性软化"这些标签,都能在这套理论里找到对应的临床概念。家庭场景则主要依托结构式家庭治疗,像"边界/层级紧张""跨代联盟"这些标签,对应的是家庭里谁跟谁结盟、谁的边界被侵犯这类结构性问题。

这个设计思路挺聪明的地方在于,它没有让AI去发明一套"看起来合理"的标签体系,而是直接借用了几十年积累下来的临床智慧。这就像做医学AI诊断系统,你不会让工程师自己拍脑袋定义"什么是发烧",而是直接采用医学界公认的体温标准。

支持策略的标签同样精心设计,咨询师的每一种干预方式都对应着具体的理论功能,比如"track"(跟踪并命名当下的互动循环)、"reframe"(把责怪个人重新解释为共同的关系模式)、"evoke"(引导表达更深层的脆弱情绪)、"enact"(让一方直接对另一方说出内心话,而不是只对咨询师说)。

论文里花了大篇幅去区分这些相近标签之间的边界,比如track和reframe都涉及描述互动过程,但前者只是"命名"当下发生了什么,后者是"改变"这件事的意义框架。这种细致的边界划定,恰恰体现出真实临床场景里,同一个咨询师动作背后可能有完全不同的意图,而这种意图上的细微差别,恰恰是AI最容易搞混的地方。

**长尾分布:少数标签占大头,多数标签几乎绝迹**

数据分布这块也挺有意思。夫妻对话里,"追逐-回避"和"修复性软化"两种模式加起来占了将近三分之二的比例,而最罕见的"混合过渡"和"双方回避"两种状态合计还不到10%。家庭对话里更极端,"合作式家庭联盟"一个标签就占了41.9%。

这种极度不均衡的分布直接反映在模型表现上:常见、显著的关系模式,模型识别起来相对靠谱,像夫妻场景里最常见的"追逐-回避"平均准确率能到77.38%,但那些罕见的、需要精细区分的标签,准确率就惨不忍睹,比如"混合过渡"只有2.23%,家庭场景里的"混合过渡"更是低到1.59%。

这个现象其实挺符合直觉的:模型见过的、训练数据里出现频率高的模式,它学得比较扎实,那些边缘化的、需要细致辨析的情况,它基本没有能力应对。这就像一个刚学开车的新手,在城市主干道上开得挺稳,一旦遇到需要精细判断的窄巷会车,立刻手忙脚乱。

**夫妻场景和家庭场景,模型表现不完全一样**

论文还专门比较了夫妻场景和家庭场景下模型表现的差异,结果并不是简单的"哪个更好",而是各有胜负。

介入时机预测上两者几乎打平,关系模式预测上家庭场景略高一点。但支持对象预测在家庭场景下明显更差(54.87%对66.88%的召回率),支持策略预测反而在家庭场景下平均更高一点(36.83%对30.54%)。

更有意思的是,这个规律并不是所有模型都一致的。有些模型从夫妻场景切换到家庭场景后表现明显下滑,也有模型反而表现提升,这说明不同模型捕捉关系线索的方式存在系统性差异,家庭场景涉及更多人、更复杂的联盟结构,这对模型的考验方式和夫妻场景的两人对抗结构完全不同。

**写在后面**

读完这篇论文,最让我意外的一个细节,是那个关系状态转移矩阵的分析。我原本以为,人际关系的负面循环一旦形成,要么持续恶化,要么突然翻转变好,论文里的数据却告诉我,现实远比这更纠缠——"追逐-回避"这种模式,即便短暂进入了修复阶段,也会像退潮又涨潮一样反复冒头。这个发现让我重新想了想,自己身边那些"每次吵架都一个模子刻出来"的关系,原来背后可能真的存在一种可以被观察和量化的循环结构,而不只是"性格不合"这种模糊说法能解释的。

另一个让我停下来想了很久的地方,是论文里反复强调的那种区分:AI能识别一个人此刻是什么情绪,但很难识别这个人对另一个人的看法。这两者听起来接近,实际上是两种完全不同的认知任务。前者是内省,后者是归因,后者要求理解说话人为什么这样表达,以及这种表达背后可能藏着的另一层真实想法。这让我想到,人和人之间大部分误会的根源,可能恰恰就藏在这层"归因"上,而不是情绪本身。

这篇论文没有给出一个能立刻解决关系冲突的AI系统,它做的事情更朴素:告诉你现在的AI在哪些地方还看不懂,看不懂到什么程度。这种诚实的失败分析,有时候比一个夸大其词的成功案例更有价值。

如果有一天真的出现了一个能听懂夫妻吵架、能分辨谁在追谁在躲、能判断该先安慰哪一个人的AI,你会愿意让它介入你自己的关系吗?

Q&A

Q1:RESCUE-BENCH是什么?

A:RESCUE-BENCH是香港理工大学团队构建的一个关系感知情感支持对话基准数据集,由真实的夫妻和家庭心理咨询访谈视频标注而成,包含191个样本、7079个标注对话轮次,用于评测AI能否理解多人关系动态并做出恰当的情感支持决策。

Q2:为什么现有的AI情感支持系统在多人场景下表现不好?

A:因为传统AI情感支持系统只关注单个用户的情绪状态,采用一对一聊天模式,即使扩展到多人场景也只是各自安慰各自,完全没有建模人与人之间的关系动态、互动模式和相互影响,而这些关系因素恰恰是多人情感困境的核心症结。

Q3:测试结果显示大模型在哪些任务上表现最差?

A:大模型在关系模式预测、观点预测和支持策略预测这三项任务上表现明显较差,其中关系模式预测准确率最高只有45.6%,支持策略预测召回率仅31.88%,说明现有AI擅长识别单个情绪但难以理解复杂的人际关系动态。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
车主讲述高速充电“囧途”:有人跑4个服务区排队3小时才充上 有人排队4.5小时充电还限量

车主讲述高速充电“囧途”:有人跑4个服务区排队3小时才充上 有人排队4.5小时充电还限量

红星新闻
2026-10-02 23:26:16
板上钉钉!安东尼奥将出任国奥主帅,更希望他率国家队冲击世界杯

板上钉钉!安东尼奥将出任国奥主帅,更希望他率国家队冲击世界杯

刀锋体育
2026-10-03 18:29:44
刘欢去世7天,何赛飞病情曝光让人心痛,与恩师之子离婚水落石出

刘欢去世7天,何赛飞病情曝光让人心痛,与恩师之子离婚水落石出

最新声音
2026-10-03 01:49:54
不能纵容特殊人群挑战全国人民的底线!不能容忍歧视企业退休人员

不能纵容特殊人群挑战全国人民的底线!不能容忍歧视企业退休人员

起喜电影
2026-09-27 12:36:54
争议?曝豪夺7金的张展硕无缘亚运会MVP 20岁汶颂当选:奖金17万元

争议?曝豪夺7金的张展硕无缘亚运会MVP 20岁汶颂当选:奖金17万元

风过乡
2026-10-03 09:22:21
外媒:发型图未经同意被P在飞机上,球星哈兰德起诉挪威航空

外媒:发型图未经同意被P在飞机上,球星哈兰德起诉挪威航空

环球网资讯
2026-10-02 16:56:10
国庆高速服务区排队太折磨 雷军:开澎程不需要排队充电或加油

国庆高速服务区排队太折磨 雷军:开澎程不需要排队充电或加油

快科技
2026-10-02 15:11:04
美企为什么抢着参加特朗普的欢迎宴?

美企为什么抢着参加特朗普的欢迎宴?

小眼睛小世界
2026-10-03 07:36:30
谁都没想到,刘欢离世后,55岁韩红因一个举动被推上“风口浪尖”

谁都没想到,刘欢离世后,55岁韩红因一个举动被推上“风口浪尖”

皮皮电影
2026-10-03 08:10:44
梁安琪早已确认?赌王多年未公开的儿子何猷邦身份曝光,生母真是利智吗?

梁安琪早已确认?赌王多年未公开的儿子何猷邦身份曝光,生母真是利智吗?

动物奇奇怪怪
2026-10-03 12:16:38
一个接口活了近40年,IBM自己都收不回来

一个接口活了近40年,IBM自己都收不回来

我是一个粉刷匠2
2026-10-02 00:11:27
小S携徐妈妈现身香港,粉色衣气色红润笑意挂眼角,状态真的回来了!

小S携徐妈妈现身香港,粉色衣气色红润笑意挂眼角,状态真的回来了!

广西辉哥
2026-10-03 00:32:15
深圳车主走应急车道,两天被罚6000元,扣12分!登上热搜!网友:支持全国推广

深圳车主走应急车道,两天被罚6000元,扣12分!登上热搜!网友:支持全国推广

南方都市报
2026-10-03 18:17:24
韩媒:汉字并非中国独有,韩国也将实施全民汉字教育

韩媒:汉字并非中国独有,韩国也将实施全民汉字教育

小豫讲故事
2026-10-03 06:00:22
前三季度哪些基金业绩最差?追错方向,多只逼近腰斩

前三季度哪些基金业绩最差?追错方向,多只逼近腰斩

财联社
2026-10-03 18:29:08
33岁章泽天风格大变!穿艳俗纱裙、副乳突出,比实际年龄成熟10岁

33岁章泽天风格大变!穿艳俗纱裙、副乳突出,比实际年龄成熟10岁

阿讯说天下
2026-04-18 14:53:39
国庆高速实测曝光:600公里跑下来,电车车主集体沉默了

国庆高速实测曝光:600公里跑下来,电车车主集体沉默了

阿芒娱乐说
2026-10-03 11:09:15
日本外相沉不住气,忍不住说出心里话:不许中国援引“敌国条款”

日本外相沉不住气,忍不住说出心里话:不许中国援引“敌国条款”

墨兰史书
2026-10-03 14:20:10
不敢相信!亲手点赞贬低队友的视频,罗哥最后的体面也不要了?

不敢相信!亲手点赞贬低队友的视频,罗哥最后的体面也不要了?

涛哥侃球
2026-10-03 23:08:07
网传海宁将卸任中国男排主教练:亚运会后离任

网传海宁将卸任中国男排主教练:亚运会后离任

懂球帝
2026-10-03 16:18:21
2026-10-03 23:28:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4954038文章数 9714关注度
往期回顾 全部

科技要闻

英伟达盘中创历史新高,市值逼近6万亿美元

头条要闻

女生遭美国常春藤名校7名男生下药性侵 最新后续来了

头条要闻

女生遭美国常春藤名校7名男生下药性侵 最新后续来了

体育要闻

这个讨论了一夏天的问题,马刺有答案了吗

娱乐要闻

马思纯一家爬山祈福!素颜出镜笑容甜

财经要闻

4亿台电视挂墙落灰 为何没人愿意开了?

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

家居
时尚
本地
数码
艺术

家居要闻

2026建博会(广州) 公装联探展交流活动

Chemena Kamali写给Chloé的又一封情书

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

数码要闻

QCY推出Crossky C70耳夹式耳机,399元

艺术要闻

广州又封顶一栋总部!楼像水晶,主人是A股龙头

无障碍浏览 进入关怀版