在构建自动整理Jira待办项的实验中,我此前用Gemini作裁判来对比两个大模型的聚类输出,却发现Gemini屡次把正确的算术推理想成“幻觉”。
这到底是Gemini独有的怪癖,还是LLM裁判共有的盲区?唯一检验方法就是引入另一种评判者——不是换个中立第三方,而是让被评价的两个模型交叉互评。
于是,我让Claude Sonnet 4.5给GPT-5.5的全部6份输出打分,又让GPT-5.5给Claude的全部输出打分,评分标准完全沿用Gemini的规则。
这样每个输出就拥有三份独立分数:我的人工评分、Gemini的评分,以及另一个模型的“交叉评判”。
![]()
需要说明的是,这个设计并非检验模型会不会偏袒自己——Claude从不评自产内容,GPT-5.5也同样,两者互评的是对方作品。真正要考察的是:一个模型对竞争对手的输出,是否比中立裁判和人类更为严苛或宽松。
简单平均三份分数并不公平,因为Gemini和交叉评判者都是LLM,而此前实验已经表明它们共享一类偏见——将模型自主推理但未经显式引据的推断,一律归为“幻觉”。这种偏见在“数据综合”“时间感知推理”等关键标准上尤其突出。若把三位打分者等权平均,那么这股系统性偏差就占了三分之二的票数,不会自然抵消。
所以我设定了一套加权:人类评分占50%,Gemini评分占25%,交叉评判占25%。
每条输出每项标准的复合得分 = 0.5×人工分 + 0.25×Gemini分 + 0.25×交叉评判分。随后,按适用标准累加复合得分,再除以适用标准的满分总和,得到最终百分比得分。
这个分数直接回答了一个问题:在人类判断主导权重的前提下,这份输出究竟有多好?
对于曾被Gemini报出“幻觉”的具体案例,处理也格外谨慎。若我此前(在第二部分实验中)已校验过某个推理声称是合规的,那它就维持原判;若是未曾复核的新标记,则保留为存疑提醒,而不是用少数服从多数来抹平。
在交叉评判的帮助下,我终于凑够了计算Kappa值的数据。加权后的排名一旦被重新计算,原本依赖单一Gemini裁判得出的“最佳模型”结论就发生了改变,给我提供了真正答案——能把哪个模型放到经理面前。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.