大模型做跨国调查问卷,模拟出来的"受访者"靠谱吗?清华等高校最新研究给出了一个值得警惕的答案:模型对澳大利亚、北美、欧洲的模拟更准确,而对其他地区的模拟精度明显偏低。
系统性偏差,不是偶然
![]()
这项研究提出了一个名为"表征平等"的评估框架,专门用来检验大语言模型作为合成受访者时,模拟精度是否在不同群体间均衡分布。测试规模不小:覆盖59个国家、2420个亚组,并动用了9个开源模型。
![]()
结果发现,这种模拟不平等是系统性的,并非个别模型的偶发问题。模型在模拟高收入国家人群时表现更好,而在模拟其他国家时则存在明显落差。
精度与GDP挂钩,暴露数据短板
更值得关注的是数据背后的关联:国家模拟精度与人均GDP、互联网普及率呈正相关。也就是说,经济越发达、网络越普及的地区,模型模拟得越准。
![]()
这背后指向一个老问题——训练数据的分布不均。富裕国家在互联网上的内容产出更多,模型学到的样本自然更充分;而欠发达地区的数据相对稀缺,模拟精度自然打折。
这项研究提醒我们,如果要用大模型替代真实受访者做跨国调查,"偏科"问题必须正视。否则,调查结果可能会在不知不觉中偏向某些地区的声音。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.