网易首页 > 网易号 > 正文 申请入驻

大模型作为评估者的「偏好」困境:UDA实现无监督去偏对齐

0
分享至

来源:市场资讯

(来源:机器之心)

在 LLM 评估体系日益依赖 "大模型担任评估者"(LLM-as-a-Judge)的今天,一个隐秘且严重的问题正在扭曲大模型的评估生态:偏好偏差。

即使是性能强劲的 GPT-4o 和 DeepSeek-V3,在进行成对答案比较时,也会系统性地偏爱特定输出 —— 尤其是自己生成的内容。这种偏差导致不同裁判模型给出的评分和排名天差地别。论文中的实验数据显示,在 ArenaHard 数据集上,自我偏好偏差幅度从 - 38% 到 + 90% 不等。当模型既是 "运动员" 又是 "裁判" 时,公平性无从谈起。

现有解决方案依赖提示工程、模型集成或博弈论重排等,但这些方法要么缺乏理论支撑,要么成本爆炸,要么难以扩展。更重要的是,它们都依赖人工设计的规则,没有办法让大模型输出统一的结果。

UDA 的出现,为破解这一困局提供了新思路。来自智谱 AI 的研究团队将无监督学习引入成对 LLM 评判体系,让模型能够自主动态调整评分规则,实现去偏对齐。

该论文已被 AAAI 2026 录用。

  • 论文标题:UDA: Unsupervised Debiasing Alignment for Pair-wise LLM-as-a-Judge

  • 论文链接:https://arxiv.org/pdf/2508.09724

  • 代码仓库:https://github.com/zhang360428/UDA_Debias

评判偏差:大模型担任评估者的 "偏好之困"

现有的 LLM 评判系统(如 Chatbot Arena)普遍采用 Elo 评分机制,但面临着三类挑战:

  • 自我偏好固化:模型系统性高估自己生成的答案,导致 "谁当裁判谁占优" 的荒谬局面;

  • 异质性偏差:不同模型的偏差方向与强度各异,从激进自夸到过度谦逊不一而足;

  • 静态评分缺陷:传统 Elo 使用固定 K 因子,无法区分关键对决与平庸比较,小样本下信噪比极低。

结果就是 "评分失准"、"排名震荡" 频发:如下图所示,在未经优化前,10 个主流 LLM 裁判对同一组答案给出的 Elo 分数标准差最高能达到 158.5 分,评分轨迹如脱缰野马般离散。而经过 UDA 对齐后,各裁判轨迹显著收敛,共识稳定度提升近 60%。

UDA 的核心贡献在于将去偏问题转化为一个可通过动态校准优化的序列学习问题。与以往依赖人工规则或监督信号的方法不同,UDA 让评判者在处理每对比较时自主探索最优的评分策略,并通过共识最小化目标直接获得反馈。这种无监督的优化方式使模型能够学习到较为公平的对齐机制。

方法框架

如图所示,UDA 将成对评估建模为实例级自适应过程。对每个裁判模型 k,当比较答案对 (ai, aj) 时,系统提取多重特征,通过轻量级网络动态生成调整参数,最终输出校准后的 Elo 更新。训练过程中通过共识锚定目标获得反馈。被训练的适配器 () 专注学习去偏策略,固定的 Elo 系统 (❄️) 负责基础评分。

特征工程与自适应网络

UDA 的精髓在于人类标注无关的特征构建。对每对比较,系统提取基于语义的特征向量 φ(k) ij,涵盖:

  • 高维特征:答案嵌入间的 element-wise 差值、归一化积,捕捉语义风格差异

  • 标量特征:余弦相似度、KL 散度、长度差异,量化分布距离

  • 自我感知特征:裁判自身答案与候选答案的相似度,作为偏差预警信号

这些特征无需任何人工标注,完全从响应分布中自动构建。

一个三层 MLP 网络 fθ 随后将特征映射到自适应参数:

  • 实例级 K 因子 Kij:动态调整每轮比较的权重,可疑对决自动降权

  • 软标签 (si, sj):替代硬判决,缓解偏好噪声,实现平滑更新

共识锚定:无监督对齐的基石

UDA 的核心创新是无监督的共识驱动训练。在缺乏 "黄金标准" 的困境下,UDA 将所有裁判的集体共识视为一个现实可用的优化目标。虽然共识并非完美真值,但实证表明,异质性偏差在聚合时倾向于相互抵消。

训练目标巧妙设计为多任务损失:

三项分别驱动:(i) 各裁判轨迹向共识收敛,(ii) 保持排名相关性,(iii) 强化集体一致性。最终,UDA 不追求复制共识,而是以共识为锚,压制极端个体偏好。

理论动机:为什么共识对齐能减少偏差?

UDA 的核心理论洞见是:对齐多样化裁判的共识,将降低系统总偏差。

证明:设 Ri 为模型 i 的真实 Elo 分数,ε(k) i 为裁判 k 的偏差项。在线性收缩模型下(实际情况当然会比该假设复杂,但这种趋势是相同的),UDA 对齐后的预期总绝对偏差不超过基线:

证明思路:对齐过程可视为向平均偏差的凸组合收缩,通过三角不等式和 Jensen 不等式即可得证。虽然个别校准良好的裁判可能轻微牺牲精度,但集体方差缩减主导了个体成本。

这一理论为无监督对齐提供了动机:即使共识本身有噪声,减少离散度仍能提升整体可信度。

实验结果

UDA 在 ArenaHard(500 问题,10 大模型,45 万对比较)上训练,在零样本迁移中展现了非常好的效果:

主实验

训练集与测试集上不同大模型评估的方差:

测试集上评估结果与人类评估的相关性系数:

四大核心发现:

1. 跨模型方差锐减:UDA 将平均裁判间标准差从 158.5 降至 64.8(↓59%),最激进的 gemini-2.0-flash 偏差从 341.9 压缩至 128.8,证明对极端偏差的强效抑制。

2. 人类对齐跃升:在人工标注迁移集上,UDA 将平均 Pearson 相关性从 0.651 提升至 0.812(+24.7%),将弱裁判(如 glm-4-flash)提升至与顶尖行列大模型(deepseek-r1)相当水平,实现评估民主化。

3. 零样本迁移稳健:在未见过的新的迁移数据集上,UDA 未经重新训练仍实现 63.4% 的方差缩减,证明领域无关的去偏能力。

4. 自我感知特征的决定性:消融实验显示,移除大模型自身回答相关特征后,虽然方差进一步降至 65.64,但人类相关性暴跌至 0.510。这可能是因为缺乏自我意识的模型会盲目收敛,却是却偏离人类真值。

消融研究:自我感知特征的关键作用

为验证所选特征的必要性,该研究团队训练了 UDA(Ablated)变体,剔除所有与裁判自身答案相关的特征:

实验结果显示:剔除自我感知相关特征后,模型过度优化共识一致性,牺牲了人类对齐。自我感知特征如同 "偏差镜子",让裁判能识别并折扣自身偏好,从而引导集体判断朝向客观真值。

总结

UDA 让我们看到一个重要趋势: "评判校准不再是提示工程问题,而是可以被学习的问题。" 通过无监督共识信号,模型不再依赖人工撰写的去偏提示,而是在交互中自主演化出公平评分策略。

这项研究针对现有评估中不同 LLM 评委存在的系统性自偏好偏差以及评分不一致问题,通过轻量级神经网络动态调整 Elo 评分系统的 K 因子与胜负概率,实现实例级别的去偏矫正正。其核心思想是将所有评委评分的集体共识作为无监督优化目标,通过最小化各评委 Elo 轨迹的离散度来抑制极端个性偏差,同时利用评委自身回答的语义等特征检测自偏好倾向。该框架有效提升了低质量评委的表现,使其接近高质量评委水平,显著增强了评估的鲁棒性、可复现性与人类对齐度。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
冲上热搜!浙江一地推出“猪景房”,8888元一晚!牧场回应:入住送一头价值6888元的猪

冲上热搜!浙江一地推出“猪景房”,8888元一晚!牧场回应:入住送一头价值6888元的猪

农视网
2026-09-17 17:08:34
新股鸿富诚公布中签结果,中签号码仅1.31万个,股民中了注定吃大肉!

新股鸿富诚公布中签结果,中签号码仅1.31万个,股民中了注定吃大肉!

数据挖掘分析
2026-09-18 07:08:51
印度在南海养条恶犬,随时准备扑上来撕咬,印媒:让中国知道厉害

印度在南海养条恶犬,随时准备扑上来撕咬,印媒:让中国知道厉害

风流女汉
2026-09-16 20:12:56
为什么一见面就是睡觉,一有机会就不停发生关系?

为什么一见面就是睡觉,一有机会就不停发生关系?

阿凯销售场
2026-09-18 10:23:29
压轴机王!新机官宣:9月29日,发布即开售!

压轴机王!新机官宣:9月29日,发布即开售!

科技堡垒
2026-09-16 11:58:11
压垮南方医科大学博士高材生的最后一根稻草揭晓

压垮南方医科大学博士高材生的最后一根稻草揭晓

大熊欢乐坊
2026-09-17 17:30:58
还有7天中秋节,社会却出现了6个“怪现象”,与往年大不相同!

还有7天中秋节,社会却出现了6个“怪现象”,与往年大不相同!

爱生活的陶哥
2026-09-18 08:42:22
乌克兰民众储备半自动霰弹枪,用以击落俄无人机:击落几率相当高

乌克兰民众储备半自动霰弹枪,用以击落俄无人机:击落几率相当高

章幃户外
2026-09-17 08:10:13
日本异世界动画里的城镇怎么都一样?粉丝的感慨引发热议

日本异世界动画里的城镇怎么都一样?粉丝的感慨引发热议

ACG萌博士
2026-09-17 14:16:43
中国男篮vs日本临时调整!CCTV5不直播,暗藏三个信号

中国男篮vs日本临时调整!CCTV5不直播,暗藏三个信号

属于自己的光
2026-09-17 22:17:21
也门政府军与胡塞武装在多条战线持续交火

也门政府军与胡塞武装在多条战线持续交火

环球网资讯
2026-09-18 09:05:08
中俄投了反对票

中俄投了反对票

陆弃
2026-09-18 10:43:25
1987年,邓公开会时指着刘洪二人,询问杨尚昆:他们命令下了没?

1987年,邓公开会时指着刘洪二人,询问杨尚昆:他们命令下了没?

简史档案馆
2026-09-03 11:05:03
京沪高铁收支出炉:运行满 15 年,总投资约 2209 亿,回本了吗?

京沪高铁收支出炉:运行满 15 年,总投资约 2209 亿,回本了吗?

抽象派大师
2026-09-15 13:35:53
一针没打的280万人,2026年身体真相曝光

一针没打的280万人,2026年身体真相曝光

华庭讲美食
2026-08-26 01:21:08
“一箱子高科技加寒,你女儿想健康都难!”母亲给女儿的爱心行囊,被骂惨!

“一箱子高科技加寒,你女儿想健康都难!”母亲给女儿的爱心行囊,被骂惨!

林林先生
2026-09-17 16:34:42
只议事、不生事!印度主办金砖很成功,美学者:中国应帮印度入常

只议事、不生事!印度主办金砖很成功,美学者:中国应帮印度入常

国际法大视野
2026-09-17 11:34:27
香山论坛闭幕:朝鲜规格生变,董防长重磅发声,中国智慧再成焦点

香山论坛闭幕:朝鲜规格生变,董防长重磅发声,中国智慧再成焦点

奇思妙想生活家
2026-09-18 05:23:52
“这颜值,放艺术生里也是顶级了!”家长晒素颜大一女儿哭鼻子,院校揭晓网友都慕了

“这颜值,放艺术生里也是顶级了!”家长晒素颜大一女儿哭鼻子,院校揭晓网友都慕了

妍妍教育日记
2026-09-14 20:51:56
是时候揭开真相了:当年对越作战的损失或许远超人们想象,仅从那些牺牲的将门之后就能看出端倪

是时候揭开真相了:当年对越作战的损失或许远超人们想象,仅从那些牺牲的将门之后就能看出端倪

人生录
2026-08-26 00:05:15
2026-09-18 12:39:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4812893文章数 9639关注度
往期回顾 全部

科技要闻

苹果店外黄牛蹲守:18 Pro Max加价500

头条要闻

特朗普考虑大规模打击伊朗 媒体:美大致有两种选择

头条要闻

特朗普考虑大规模打击伊朗 媒体:美大致有两种选择

体育要闻

一个角色球员,靠什么在NBA征战17年

娱乐要闻

敬一丹逝世 央视送别,女儿成“心病”

财经要闻

中国汽车:尾大不掉,必须出清

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

房产
家居
艺术
健康
公开课

房产要闻

突发!三亚安居房出台新政!

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

韦启美 81岁时画的这幅瓶花,28.75万!

剧烈头痛伴呕吐,警惕脑动脉瘤破裂

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版