清华NLP等机构在《计算语言学》期刊提出"表征平等"概念与评估指标,检验9个开源模型能否均匀模拟不同国家人群,覆盖59国与2,420个子群体。
系统性偏差:欧美更准,中东被"拉向"美国
![]()
研究发现,模型对欧美国家的模拟准确度显著更高,且这种偏差与人均GDP、互联网普及率等指标呈正相关。更值得注意的是,模型在模拟中东国家时,倾向将其分布拉向美国数据分布。
![]()
检索增强最有效,偏好对齐无增益
在改进手段上,检索增强是最稳健的方案——GLM-4-9B的表征平等指标(EqCV)从0.0486降至0.0255,偏差几乎减半。而偏好对齐方法未带来系统性改善。
![]()
这项研究为评估大模型的地域公平性提供了可量化的新工具,也为后续改进模型的多国模拟能力指出了明确方向。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.