网易首页 > 网易号 > 正文 申请入驻

给语言模型装一个"纠错外挂",能不伤原有能力吗?

0
分享至


你有没有遇到过这种情况:家里的老电器用久了,某个功能开始出毛病,你拿去修,结果修好了这个毛病,别的功能却跟着坏了。

大语言模型的纠错也面临同样的困境。

模型会犯错,说错事实、算错数字、给出脱离实际意图的建议。想让它改正,最直接的办法是重新训练它,比如用LoRA这种参数高效微调技术

LoRA*:一种给大模型"打补丁"的训练方法,不改动原始参数,而是额外加一小组低秩矩阵去学习新知识

或者干脆全量微调。但问题来了:模型学会了改正某几个具体错误,却在这个过程里悄悄忘掉了一些它原本会的东西。这在学术圈有个专门的说法,叫灾难性遗忘

灾难性遗忘*:模型在学习新任务时,覆盖或干扰了之前学到的旧知识,导致旧任务表现下降

这就是这篇论文要死磕的问题:纠错和保能力,真的只能二选一吗?

**核心问题:为什么"修一个坏一片"几乎是行业默认**

如果你去看以往的纠错研究,会发现一个规律:只要动了模型本身的参数,哪怕只动一小部分,都会在某种程度上牺牲模型原本的能力。这不是哪家团队没做好,而是这类方法结构性带来的副作用。ROME和MEMIT这类模型编辑技术,直接定位并且改写模型权重里存的某个事实,效果立竿见影,但也是在动"骨头",改的地方越精准,波及面看似越小,可一旦改错或者改多了,照样伤筋动骨。

这篇论文的作者换了个思路:能不能压根不碰模型本体,把纠错这件事外包给一个完全独立的小模块?

这就是CRN v2(Cognitive Resonance Network,认知共振网络第二版)的核心设定。

CRN v2*:一个约3400万参数的轻量级纠错模块,安装在一个完全冻结不动的Gemma 4 E2B大模型之上,只负责在最后一步给输出的"打分表"(logits)做微调

Gemma 4 E2B*:谷歌开源的一款46.5亿参数(文本部分)的语言模型,本论文里作为被纠错的"病人",全程冻结不训练

这个设定听起来简单,但背后是一个很清楚的判断:原模型的知识和能力,是脆弱的,一旦被梯度更新触碰,就有走样的风险。与其修理它,不如在它输出结果之后,加一层"审核"。

打个比方,这就像一家餐厅的老师傅做菜手艺很稳,但偶尔某道招牌菜会放多盐。老板不想让他重新学做菜,怕他手感全乱;于是找了个专门的"调味师",站在出菜口,尝一口不对劲的菜,悄悄加点糖中和一下,其他菜一律放行不动。如果反过来让老师傅回炉重造整套厨艺,很可能这道招牌菜是咸淡刚好了,可另外十道拿手菜的火候全变了。CRN v2就是这个不动老师傅、只在出菜口把关的调味师。

**方法拆解:logits层面的"最后一道关卡"**

CRN v2具体怎么工作?公式并不复杂:模型跑完自己的推理流程,产生一个原始的logits(也就是每个候选词的打分),CRN v2这时候读取模型最后一层的隐藏状态,通过一个小型的低秩网络,算出一个"修正量",叠加到原始logits上,构成最终输出。

logits*:模型在预测下一个词时,给词表里每个候选词打的分数,分数越高,被选中的概率越大

低秩矩阵*:把一个很大的参数矩阵拆成两个小矩阵相乘的近似表示,参数量大幅减少但仍能捕捉主要变化方向

这个修正模块只有三样东西可学:一个降维矩阵、一个升维矩阵,加一个初始值接近零的"闸门"标量。闸门这个设计很讲究,它意味着刚开始训练时,修正模块几乎不干预原始输出,随着训练推进,它才慢慢学会在合适的时机"发力"。

训练分两步走。第一步是监督微调(SFT),用8.34万条纠错样本对,每条样本把"正确答案"喂给模型学习,同时加了一个叫KL保持项的约束。

SFT*:Supervised Fine-Tuning,监督微调,用标注好的正确答案训练模型

KL散度*:一种衡量两个概率分布差异程度的数学指标,这里用来衡量修正后的输出分布和原始模型输出分布之间差了多少

这个KL约束的作用是,逼着修正模块在原模型答对的地方老老实实贴近原模型的分布,只在原模型答错的地方才允许自己"改口"。第二步是无参考DPO,直接拿原模型答错的内容当作"反例",让修正模块学会更偏好正确答案。

DPO*:Direct Preference Optimization,直接偏好优化,一种不需要额外奖励模型,直接通过"好答案vs坏答案"的对比来调整模型输出偏好的训练方法

这个KL约束到底有多重要?论文做了个对照实验:把KL权重从0.1降到0.01,纠错率直接从53.3%掉到35.0%。这说明这根"锚绳"不是摆设,而是真正在撑着修正模块不要跑偏。

这就好比给一艘小船配了根锚绳,绳子松一松,船看着好像更自由了,能划得更远,但实际上它已经开始随波乱漂,找不准方向了。如果彻底剪断这根绳子(也就是不用KL约束训练),修正模块很可能学到一堆"讨好训练数据"的捷径,看着分数涨了,实则丢了原本该守住的行为边界。

**实验结果:纠错和保能力,到底能不能兼得**

研究团队设计了一场叫CEHRI(认证人机智能)的60题域内考试,涵盖事实类、算术类和隐含目标推理三种题型,用来测纠错能力。同时用MMLU、BoolQ两个通用能力测试集(各200题)加一个仅8题的car-wash测试,检验模型原本的能力有没有被拖累。

MMLU*:大规模多任务语言理解测试集,覆盖各学科知识,常用来衡量模型的综合知识水平

BoolQ*:一个阅读理解测试集,题目是"是/否"判断题,用来测模型的文本理解能力

结果摆出来相当直接。原始的冻结基座模型在60道考题里只答对7题,正确率11.7%。加上CRN v2之后,答对题数涨到32题,正确率53.3%,换句话说是新增了25道对题。换成加了一点措辞改写的"改写版"考卷(120题),CRN v2的纠错率是43.3%。

再看对照组LoRA基线,用和CRN v1同等的参数预算(约660万参数)训练,纠错率是83.3%,改写版是77.5%,数字上确实比CRN v2高出一大截。

但代价呢?LoRA在MMLU上的得分从原本的62.5%暴跌到32.0%,掉了30.5个百分点;BoolQ从72.0%掉到55.0%,掉了17个百分点;car-wash这个只有8题的小测试,LoRA直接0分全军覆没,从75%的正确率跌到0。

CRN v2在这三项能力测试上,分数和原始冻结模型一模一样,没有任何下滑。

这组数字放在一起看,冲击力才出来:LoRA确实纠错纠得更狠,但它像是把病人的病灶切了,顺带把周围健康组织也切没了。CRN v2纠错力度弱一些,但手术刀根本没碰到健康组织。

论文还测了HellaSwag,不过这项测试因为评分脚本的bug,两个模型都得了0分,作者坦诚说明这是个已知问题,不纳入任何结论。这种诚实交代反而让人更信任其他数据。

**深挖一层:把修正点往模型内部挪,会更好吗**

既然logits层面的修正有效,研究团队很自然地会问:如果把修正动作从最后一层往前挪,让它先被模型内部剩下的那些层"放大处理"一遍,会不会效果更好?

于是他们做了一个探索性实验,叫隐藏状态注入。原理是在模型第k层的隐藏状态上加一个类似的低秩修正,让这个修正随着后续层数一路往前传播、被继续加工。

隐藏状态*:Transformer模型内部每一层输出的中间表示向量,包含了模型对当前输入到这一层为止的理解

他们试了两个深度:第7层(后面还有27层帮忙"放大")和第4层(后面还有30层)。结果有点反直觉:第4层只拿到30.0%/28.3%的纠错率,第7层拿到50.0%/55.8%,但这两个数字,哪怕是更深、被放大次数更多的第7层,依然没能超过最简单的logits层修正(53.3%)。

这个结果挺打脸的,理论上讲注入得越深、后面能加工放大的层越多,效果应该越强,但实测下来根本没发生。这提示了一件事:模型内部那些冻结的层,并不天然会"放大"一个外来的小修正,它们只是照常处理这个输入而已,修正信号在传播过程中很可能被稀释、被别的计算路径盖过。

更麻烦的是,团队还试着在第7层注入的基础上加一轮DPO训练,结果纠错率纹丝不动(50.0%/55.0%),但能力测试直接崩了,MMLU掉到13%,BoolQ输出退化成固定答案。这说明DPO这种偏好优化一旦作用在模型内部深层,它产生的梯度会经过27层冻结层继续传播,把下游所有计算都搅乱了。

这就像你往一条流水线的中间工位加了个"质检员",质检员本身干得挺好,纠错也没问题,可你一旦让他用更激进的手段去"施压"整条线(也就是DPO训练),流水线后面的所有工位都开始乱套,产出的东西全废了,哪怕质检员这一步本身没出错。

团队还试了把多个层的隐藏状态拼起来一起用(约3500万参数),结果反而更差,只有40%;又试了把训练时间拉长到5000步SFT加2000步DPO,纠错率还是停在53.3%,没有任何提升。

这些尝试拼在一起说明一件事:logits层面这个最简单的方案,目前看是这几种设计里表现最好的一个,而且加参数、加训练时间都没能突破它。论文作者很谨慎地说,这只是"目前测过的配置里最好的结果",不是"理论上的天花板",因为这些深层注入实验只跑了一次,而且实验日志有一部分在磁盘维护时弄丢了,checkpoint也没保留,没法拿去二次验证。这种坦诚交代实验的局限性,在AI论文里其实不算常见。

**这套设计到底解决了什么根本矛盾**

说到底,这篇论文想解决的矛盾是:修正能力和保留能力,是不是必须此消彼长?

答案某种程度上是:如果你完全不碰模型本体的参数,只在输出的最后一步做加法式的修正,同时用KL约束把这个修正锚定在原模型的行为附近,那确实可以做到零能力损耗,代价是纠错力度打了折扣,只能修掉五成左右的错误,而不是LoRA那样接近八成五。

这个取舍值不值得,要看场景。论文里说得很实在:一个能修好一部分错误、但其余能力完全靠得住的系统,可能比一个修错率更高、但随时可能在别的地方"翻车"的系统,更适合真实部署。

值得说明的是,这个53.3%的纠错率,测试用的60道题全部逐字出现在训练数据里,属于同分布测试,并不能说明这套方法在完全没见过的新问题上表现如何。论文对此毫不回避,专门用一整段说明这一点,还测了改写版考题(表面改了措辞,但和原题相似度中位数高达0.972),结果纠错率降到43.3%,进一步印证这套系统目前测的是"认识的题答得好不好",还没触及"没见过的题能不能推理出来"这个更硬核的问题。

**写在后面**

读完这篇论文,我印象最深的其实不是53.3%这个数字,而是那个"深层注入没能超过logits层修正"的反直觉结果。

按常理推测,往模型内部埋修正、让后面的层帮忙放大,应该比只在最后一步打补丁更有效才对,这也是很多模型编辑类工作的基本假设。但这篇论文用实测数据说明,至少在这套架构和这批数据上,这个直觉是错的。冻结的层不会主动帮你放大一个外来信号,它们只是按部就班处理输入,这提醒我们,很多"看起来应该有效"的架构直觉,其实经不起简单的对照实验。

另一个值得琢磨的地方是,作者反复强调53.3%是"目前测过的最好结果"而不是"理论上限",还专门交代了哪些实验数据丢失了、哪些没法复现。在一个论文普遍追求"效果拔群"的环境里,这种克制反而让人更愿意相信剩下的数据是真的。

这套思路会不会用在别的模型上?论文说这个设计原则不专属于Gemma 4 E2B,任何冻结的语言模型都可以配一个类似的纠错模块。真正的问题是,当纠错力度需要突破五成、逼近八九成的时候,这种"完全不碰本体"的克制还能不能继续撑住,还是说到了某个阈值,代价就无法避免地显现出来。

Q&A

Q1:CRN v2是什么?

A:CRN v2是一个约3400万参数的轻量级纠错模块,安装在完全冻结的Gemma 4 E2B大模型之上,通过修正最后一步的logits来改正模型的错误输出,而不改动模型本身的参数。

Q2:CRN v2和LoRA相比效果怎么样?

A:LoRA纠错率更高(83.3% vs 53.3%),但会让模型在MMLU、BoolQ等能力测试上大幅退化(最高掉75个百分点);CRN v2纠错率较低,但在所有测试的能力基准上零损耗。

Q3:把纠错模块埋得更深会不会效果更好?

A:论文测试发现并不会。第7层注入的纠错率是50.0%/55.8%,第4层是30.0%/28.3%,两者都没超过最简单的logits层修正(53.3%),说明冻结层并不会主动放大外部修正信号。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
4-0!39岁梅西双响+1V3破门 助迈阿密终结5轮不胜 生涯已进934球

4-0!39岁梅西双响+1V3破门 助迈阿密终结5轮不胜 生涯已进934球

我爱英超
2026-10-11 09:41:37
阿尔山口岸外出现冲天火光,消防:系境外火,正在堵截,整体可控

阿尔山口岸外出现冲天火光,消防:系境外火,正在堵截,整体可控

新京报
2026-10-11 13:52:54
有爱!库里母亲60岁与黑人壮汉再婚,库里亲自到场祝贺笑容灿烂

有爱!库里母亲60岁与黑人壮汉再婚,库里亲自到场祝贺笑容灿烂

818体育
2026-10-10 16:55:53
日本为什么忌惮朝鲜!第一,朝鲜境内没有日企,人家不稀罕。第二,朝鲜人也不用日本的东西,你在朝鲜也几乎看不见日货

日本为什么忌惮朝鲜!第一,朝鲜境内没有日企,人家不稀罕。第二,朝鲜人也不用日本的东西,你在朝鲜也几乎看不见日货

扶苏聊历史
2026-10-11 11:35:08
10月11日, 2026年调整退休人员基本养老金的通知文件尚未公布,但养老金却传来几个好消息!

10月11日, 2026年调整退休人员基本养老金的通知文件尚未公布,但养老金却传来几个好消息!

骑驴追光者
2026-10-11 10:02:47
网友吐槽阿迪海报宋雨琦指甲变犄角 门店回应:现已撤下

网友吐槽阿迪海报宋雨琦指甲变犄角 门店回应:现已撤下

快科技
2026-10-10 20:51:10
你买了吗?人社部:要把未参保人员找到动员参保,方式多种多样

你买了吗?人社部:要把未参保人员找到动员参保,方式多种多样

西昆仑Bruce
2026-10-10 19:29:26
永州周女士全网火了!离婚纠纷牵出实名举报,网友:9个男人的原配,才是最揪心的人

永州周女士全网火了!离婚纠纷牵出实名举报,网友:9个男人的原配,才是最揪心的人

火山詩话
2026-10-10 06:55:40
舆论反转!尊界踏板支架断裂事件,余承东淡定反应获网友力挺,直言“余总这波,输没输产品另说,至少没输人”

舆论反转!尊界踏板支架断裂事件,余承东淡定反应获网友力挺,直言“余总这波,输没输产品另说,至少没输人”

火山詩话
2026-10-09 14:57:30
百万粉丝博主实锤女友出轨多男,“捉奸”细节太劲爆,当场崩溃

百万粉丝博主实锤女友出轨多男,“捉奸”细节太劲爆,当场崩溃

往史过眼云烟
2026-10-10 12:06:25
中国将迎来史上最大规模的退休潮。

中国将迎来史上最大规模的退休潮。

荆楚寰宇文枢
2026-10-10 22:52:15
二十一大马上召开为什么现在重提70年代两个务必呢?

二十一大马上召开为什么现在重提70年代两个务必呢?

奇思妙想生活家
2026-10-11 13:03:56
人民币升值将引爆财富增长:人民币越值钱,你的工资房子越值钱

人民币升值将引爆财富增长:人民币越值钱,你的工资房子越值钱

兴趣知识
2026-10-11 01:12:39
杭州一火锅店排队3000桌,有网友表示“11:57取的号,22:20才吃上”;门店回应:采用正常排号和叫号方式,黄牛号会被检查

杭州一火锅店排队3000桌,有网友表示“11:57取的号,22:20才吃上”;门店回应:采用正常排号和叫号方式,黄牛号会被检查

都市快报橙柿互动
2026-10-11 00:23:24
人社部副部长李忠:“我到基层去调研的时候,和外卖小哥交流,他们和家人最担心的,就是一旦受到职业伤害之后怎么办”

人社部副部长李忠:“我到基层去调研的时候,和外卖小哥交流,他们和家人最担心的,就是一旦受到职业伤害之后怎么办”

政知新媒体
2026-10-10 13:56:36
雅思官方:10月10日中国大陆地区雅思纸笔和机考全部取消,系英国方面雅思考试系统出现技术问题

雅思官方:10月10日中国大陆地区雅思纸笔和机考全部取消,系英国方面雅思考试系统出现技术问题

和讯网
2026-10-10 15:07:43
战争就快五年了,双方兵源和动员都很困难:莫斯科30万只电子眼,盯上了自家的逃兵

战争就快五年了,双方兵源和动员都很困难:莫斯科30万只电子眼,盯上了自家的逃兵

寰球经纬所
2026-10-07 21:04:49
8000万新援处子球,亚马尔13战狂造20球,巴萨3-0赫塔费豪取9连胜

8000万新援处子球,亚马尔13战狂造20球,巴萨3-0赫塔费豪取9连胜

钉钉陌上花开
2026-10-11 03:26:42
文旅部:坚决拥护党中央决定

文旅部:坚决拥护党中央决定

新京报
2026-10-11 09:09:30
10名中国人在泰国被捕,曼谷黄金地段94套豪宅遭查扣,泰国警方披露详情

10名中国人在泰国被捕,曼谷黄金地段94套豪宅遭查扣,泰国警方披露详情

上观新闻
2026-10-11 14:04:33
2026-10-11 15:47:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
10076文章数 570关注度
往期回顾 全部

科技要闻

卸任CEO后,苹果董事长库克再度到访中国

头条要闻

特朗普建议换总统后 马斯克跟帖痛批:泽连斯基太过分

头条要闻

特朗普建议换总统后 马斯克跟帖痛批:泽连斯基太过分

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

梅艳芳63岁冥诞骨灰被盗,亲哥从不知情

财经要闻

黄仁勋长女完婚,万亿帝国如何传承?

汽车要闻

红旗天工07上市 限时16.79万起 硬核通关巴音布鲁克

态度原创

游戏
旅游
房产
手机
公开课

AI正飞速移植PS游戏到PC 最初仅2帧 如今百帧运行

旅游要闻

卢沟桥—宛平城景区10月12日下午临时闭园

房产要闻

三亚市区,200万级六层真洋房 真香!

手机要闻

团战不怕460!一加16首发自研电竞网络芯片G3、抗干扰电竞天线

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版