网易首页 > 网易号 > 正文 申请入驻

大模型作为评估者的「偏好」困境:UDA实现无监督去偏对齐

0
分享至

在 LLM 评估体系日益依赖 "大模型担任评估者"(LLM-as-a-Judge)的今天,一个隐秘且严重的问题正在扭曲大模型的评估生态:偏好偏差。

即使是性能强劲的 GPT-4o 和 DeepSeek-V3,在进行成对答案比较时,也会系统性地偏爱特定输出 —— 尤其是自己生成的内容。这种偏差导致不同裁判模型给出的评分和排名天差地别。论文中的实验数据显示,在 ArenaHard 数据集上,自我偏好偏差幅度从 - 38% 到 + 90% 不等。当模型既是 "运动员" 又是 "裁判" 时,公平性无从谈起。

现有解决方案依赖提示工程、模型集成或博弈论重排等,但这些方法要么缺乏理论支撑,要么成本爆炸,要么难以扩展。更重要的是,它们都依赖人工设计的规则,没有办法让大模型输出统一的结果。

UDA 的出现,为破解这一困局提供了新思路。来自智谱 AI 的研究团队将无监督学习引入成对 LLM 评判体系,让模型能够自主动态调整评分规则,实现去偏对齐。

该论文已被 AAAI 2026 录用。

  • 论文标题:UDA: Unsupervised Debiasing Alignment for Pair-wise LLM-as-a-Judge
  • 论文链接:https://arxiv.org/pdf/2508.09724
  • 代码仓库:https://github.com/zhang360428/UDA_Debias

评判偏差:大模型担任评估者的 "偏好之困"

现有的 LLM 评判系统(如 Chatbot Arena)普遍采用 Elo 评分机制,但面临着三类挑战:

  • 自我偏好固化:模型系统性高估自己生成的答案,导致 "谁当裁判谁占优" 的荒谬局面;
  • 异质性偏差:不同模型的偏差方向与强度各异,从激进自夸到过度谦逊不一而足;
  • 静态评分缺陷:传统 Elo 使用固定 K 因子,无法区分关键对决与平庸比较,小样本下信噪比极低。

结果就是 "评分失准"、"排名震荡" 频发:如下图所示,在未经优化前,10 个主流 LLM 裁判对同一组答案给出的 Elo 分数标准差最高能达到 158.5 分,评分轨迹如脱缰野马般离散。而经过 UDA 对齐后,各裁判轨迹显著收敛,共识稳定度提升近 60%。

UDA 的核心贡献在于将去偏问题转化为一个可通过动态校准优化的序列学习问题。与以往依赖人工规则或监督信号的方法不同,UDA 让评判者在处理每对比较时自主探索最优的评分策略,并通过共识最小化目标直接获得反馈。这种无监督的优化方式使模型能够学习到较为公平的对齐机制。

方法框架

如图所示,UDA 将成对评估建模为实例级自适应过程。对每个裁判模型 k,当比较答案对 (ai, aj) 时,系统提取多重特征,通过轻量级网络动态生成调整参数,最终输出校准后的 Elo 更新。训练过程中通过共识锚定目标获得反馈。被训练的适配器 () 专注学习去偏策略,固定的 Elo 系统 (❄️) 负责基础评分。

特征工程与自适应网络

UDA 的精髓在于人类标注无关的特征构建。对每对比较,系统提取基于语义的特征向量 φ(k) ij,涵盖:

  • 高维特征:答案嵌入间的 element-wise 差值、归一化积,捕捉语义风格差异
  • 标量特征:余弦相似度、KL 散度、长度差异,量化分布距离
  • 自我感知特征:裁判自身答案与候选答案的相似度,作为偏差预警信号

这些特征无需任何人工标注,完全从响应分布中自动构建。

一个三层 MLP 网络 fθ 随后将特征映射到自适应参数:

  • 实例级 K 因子 Kij:动态调整每轮比较的权重,可疑对决自动降权
  • 软标签 (si, sj):替代硬判决,缓解偏好噪声,实现平滑更新

共识锚定:无监督对齐的基石

UDA 的核心创新是无监督的共识驱动训练。在缺乏 "黄金标准" 的困境下,UDA将所有裁判的集体共识视为一个现实可用的优化目标。虽然共识并非完美真值,但实证表明,异质性偏差在聚合时倾向于相互抵消。

训练目标巧妙设计为多任务损失:

三项分别驱动:(i) 各裁判轨迹向共识收敛,(ii) 保持排名相关性,(iii) 强化集体一致性。最终,UDA 不追求复制共识,而是以共识为锚,压制极端个体偏好。

理论动机:为什么共识对齐能减少偏差?

UDA 的核心理论洞见是:对齐多样化裁判的共识,将降低系统总偏差。

证明:设 Ri 为模型 i 的真实 Elo 分数,ε(k) i 为裁判 k 的偏差项。在线性收缩模型下(实际情况当然会比该假设复杂,但这种趋势是相同的),UDA 对齐后的预期总绝对偏差不超过基线:

证明思路:对齐过程可视为向平均偏差的凸组合收缩,通过三角不等式和 Jensen 不等式即可得证。虽然个别校准良好的裁判可能轻微牺牲精度,但集体方差缩减主导了个体成本。

这一理论为无监督对齐提供了动机:即使共识本身有噪声,减少离散度仍能提升整体可信度。

实验结果

UDA 在 ArenaHard(500 问题,10 大模型,45 万对比较)上训练,在零样本迁移中展现了非常好的效果:

主实验

训练集与测试集上不同大模型评估的方差:

测试集上评估结果与人类评估的相关性系数:

四大核心发现:

1.跨模型方差锐减:UDA 将平均裁判间标准差从 158.5 降至 64.8(↓59%),最激进的 gemini-2.0-flash 偏差从 341.9 压缩至 128.8,证明对极端偏差的强效抑制。

2.人类对齐跃升:在人工标注迁移集上,UDA 将平均 Pearson 相关性从 0.651 提升至 0.812(+24.7%),将弱裁判(如 glm-4-flash)提升至与顶尖行列大模型(deepseek-r1)相当水平,实现评估民主化。

3.零样本迁移稳健:在未见过的新的迁移数据集上,UDA 未经重新训练仍实现 63.4% 的方差缩减,证明领域无关的去偏能力。

4.自我感知特征的决定性:消融实验显示,移除大模型自身回答相关特征后,虽然方差进一步降至 65.64,但人类相关性暴跌至 0.510。这可能是因为缺乏自我意识的模型会盲目收敛,却是却偏离人类真值。

消融研究:自我感知特征的关键作用

为验证所选特征的必要性,该研究团队训练了 UDA(Ablated)变体,剔除所有与裁判自身答案相关的特征:

实验结果显示:剔除自我感知相关特征后,模型过度优化共识一致性,牺牲了人类对齐。自我感知特征如同 "偏差镜子",让裁判能识别并折扣自身偏好,从而引导集体判断朝向客观真值。

总结

UDA 让我们看到一个重要趋势:"评判校准不再是提示工程问题,而是可以被学习的问题。"通过无监督共识信号,模型不再依赖人工撰写的去偏提示,而是在交互中自主演化出公平评分策略。

这项研究针对现有评估中不同 LLM 评委存在的系统性自偏好偏差以及评分不一致问题,通过轻量级神经网络动态调整 Elo 评分系统的 K 因子与胜负概率,实现实例级别的去偏矫正正。其核心思想是将所有评委评分的集体共识作为无监督优化目标,通过最小化各评委 Elo 轨迹的离散度来抑制极端个性偏差,同时利用评委自身回答的语义等特征检测自偏好倾向。该框架有效提升了低质量评委的表现,使其接近高质量评委水平,显著增强了评估的鲁棒性、可复现性与人类对齐度。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“这世界很酷,下辈子我肯定还来”,河北保定一32岁中学教师因病去世,最后一条朋友圈让人泪目

“这世界很酷,下辈子我肯定还来”,河北保定一32岁中学教师因病去世,最后一条朋友圈让人泪目

新浪财经
2026-09-15 19:44:30
27岁赵露思公开,与马来西亚公主合影,网友:这脸…

27岁赵露思公开,与马来西亚公主合影,网友:这脸…

In风尚
2026-09-15 12:22:34
6-4,3-1!这是开挂了:中超Big2亚冠首秀集体开门红,1轮顶上赛季全部胜场

6-4,3-1!这是开挂了:中超Big2亚冠首秀集体开门红,1轮顶上赛季全部胜场

足球大腕
2026-09-15 23:07:07
“宁王”崩了!市值蒸发7000亿拖累创指,罕见遭车企“围攻”,挤牙膏式回购引股民不满,外资投行依旧看好宁德时代,目标价770港元

“宁王”崩了!市值蒸发7000亿拖累创指,罕见遭车企“围攻”,挤牙膏式回购引股民不满,外资投行依旧看好宁德时代,目标价770港元

金融界
2026-09-15 18:45:30
一队长达75年之久未夺冠!NBA还有10队从未夺冠,5队没进过总决赛

一队长达75年之久未夺冠!NBA还有10队从未夺冠,5队没进过总决赛

无术不学
2026-09-15 12:09:00
想睡年纪大的女人,必须懂这4个试探信号,绝不翻车

想睡年纪大的女人,必须懂这4个试探信号,绝不翻车

艺鉴在线
2026-09-16 00:16:12
记者:JJ-加布里埃尔拒绝参加训练,不会出现在联赛杯大名单

记者:JJ-加布里埃尔拒绝参加训练,不会出现在联赛杯大名单

懂球帝
2026-09-15 22:05:59
小牛“不倒翁”三轮车引热议!续航560公里,遮风挡雨能上路,价格出炉

小牛“不倒翁”三轮车引热议!续航560公里,遮风挡雨能上路,价格出炉

电动车小辣椒
2026-09-13 07:33:58
2026冠中冠最新大名单:中国三将确定参赛,丁俊晖仅剩两站机会!

2026冠中冠最新大名单:中国三将确定参赛,丁俊晖仅剩两站机会!

夜深聊球
2026-09-15 21:52:48
不用抽血查激素!普通人到底该怎么选

不用抽血查激素!普通人到底该怎么选

博禾医生
2026-09-14 13:19:02
胡塞武装48小时横扫2600平方公里,大军入城不杀不抢,军纪严明秋毫不犯

胡塞武装48小时横扫2600平方公里,大军入城不杀不抢,军纪严明秋毫不犯

军武吐槽君
2026-09-11 23:41:24
我出轨后丈夫再没有碰过我,今年不舒服去体检,才知道他有多狠?

我出轨后丈夫再没有碰过我,今年不舒服去体检,才知道他有多狠?

枫红染山径
2026-09-14 09:52:16
回溯刘嘉玲 90 年被绑旧闻,不雅照轰动全港,当晚究竟经历了什么

回溯刘嘉玲 90 年被绑旧闻,不雅照轰动全港,当晚究竟经历了什么

搞笑娱乐笑话
2026-09-08 13:54:55
iPhone Duo只是开始,苹果折叠屏路线图曝光:Duo Max、翻盖Mini、第三代上Face ID

iPhone Duo只是开始,苹果折叠屏路线图曝光:Duo Max、翻盖Mini、第三代上Face ID

科技兽
2026-09-14 22:32:04
结束19年分居!央视名嘴劳春燕如今调回上海,原来她的丈夫这么牛

结束19年分居!央视名嘴劳春燕如今调回上海,原来她的丈夫这么牛

往史过眼云烟
2026-09-14 14:33:48
哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

娱你同欢
2026-08-30 18:30:43
清朝刑场老照片:骑木驴游街的妇女,瘦弱的刽子手与当时表情麻木的犯人

清朝刑场老照片:骑木驴游街的妇女,瘦弱的刽子手与当时表情麻木的犯人

雍亲王府
2026-09-14 11:40:09
2亿成本上映2次2000万票房,2年后才敢网播,这电影就是个笑话!

2亿成本上映2次2000万票房,2年后才敢网播,这电影就是个笑话!

得得电影
2026-09-14 17:09:33
《兰香如故》杜翠雀算盘落空!原来,她撮合林绣芄和杜正,不是为哥哥,是为自己

《兰香如故》杜翠雀算盘落空!原来,她撮合林绣芄和杜正,不是为哥哥,是为自己

小椰的奶奶
2026-09-16 00:17:52
大胜悬了!CCTV5直播,下午3点,中国男篮vs沙特冲四强,存一隐患

大胜悬了!CCTV5直播,下午3点,中国男篮vs沙特冲四强,存一隐患

大秦壁虎白话体育
2026-09-15 11:03:49
2026-09-16 01:07:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13997文章数 142733关注度
往期回顾 全部

科技要闻

芯片产业链蒸发超5000亿美元,特朗普大怒

头条要闻

盗窃犯刑满释放前8天改判死缓 检方称其"天生的罪犯"

头条要闻

盗窃犯刑满释放前8天改判死缓 检方称其"天生的罪犯"

体育要闻

AK47到底有多强?

娱乐要闻

谢霆锋示爱王菲、和前妻划清界限

财经要闻

黄仁勋接到特朗普电话:AI风险论是"骗局"

汽车要闻

无缝衔接?!谁懂刚上市就提车是什么体验...

态度原创

时尚
家居
艺术
数码
军事航空

真正会打扮的女人不会总穿黑色,看看这些红色系穿搭,养眼又高级

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

希施金画了幅《松林边缘》,值多少?

数码要闻

荣耀MagicOS 11已正式发布:YOYO成精、苹果破壁、老机型白捡60GB!

军事要闻

穆杰塔巴近况披露 地方官员:他身体非常健康

无障碍浏览 进入关怀版