你向AI助手吐槽同事抢了你的功劳,助手顺着你的话安慰你。但它听到的,只是你这一面的版本。对方当时怎么想的,助手无从得知。
这类社交咨询每天都在发生,评估却极难。其他人的真实意图没有标准答案,模型答得对不对,没法直接打分。Google Research 的新工作 Fuse 想解决的就是这件事:用模拟造出一份可以对照的"底稿"。
![]()
用模拟造出"标准答案"
Fuse 的做法是搭一个多智能体场景。一个带有隐藏动机的目标智能体,与其他智能体互动,其中一个是扮演用户的智能体。互动结束后,用户智能体向助手描述发生了什么,助手要做的,是推断出那个隐藏动机。
这样一来,动机是预先设定的,助手推断得准不准就有了参照。研究团队用 2.4万条人工标注验证了这些模拟的可靠性,并测试了 12个LLM。
他们同时放出了框架和 2.1万个示例。
只听到一面之词,任务会变难
测试里有一个关键变量:信息是直接给助手,还是经过用户转述。结果显示,通过用户转述事件,任务难度明显上升。
用户带有偏向性的叙述会改变助手的答案。也就是说,助手不只是在推理事实,还在被用户的措辞牵着走。
另一个发现是,模型有时比人类需要更多细节。而更长的对话、留出追问空间,并没有稳定地帮上忙。
我的判断
这项工作的价值,可能不在于给出"哪个模型社交推理更强"的排名,而在于它把一个模糊问题拆成了可操作的环节:设定动机、生成互动、转述事件、推断动机。
其中"通过用户转述"这一环尤其值得注意。它对应的是助手产品每天都在面对的现实——用户带着自己的立场来提问,助手如果照单全收,给出的建议就会偏向一方。Fuse 把这个偏差变成了可测量的对象,而不是停留在直觉层面。
至于更长的对话没能稳定提升表现,这一点对产品设计也有参考意义。追问更多细节不一定能修正判断。
框架和2.1万个示例已经放出,后续会有更多模型在这套设定下被比较。社交推理这件事,至少现在有了一个可以反复测量的起点。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.