网易首页 > 网易号 > 正文 申请入驻

当AI没有标准答案可以对照时,它要怎么学会做对一件事?

0
分享至

来源:市场资讯

(来源:科技行者)


先讲一个场景。你雇了一个新人,让他去处理客户投诉。这份工作没有考试题库,没有对错标准答案,只有一套模糊的原则:态度要好、问题要解决、别把公司搞破产。你怎么判断他做得好不好?

你大概会找一个有经验的主管,让主管看几段录像,打个分。主管可能会说"这段客户情绪激动的时候他没接住",或者"退款流程走得挺规范"。这就是打分,一次性的,针对整段表现的。

现在问题来了:这段录像有四十分钟,主管说"这段表现不行",你要怎么知道究竟是哪一分钟出了问题?是开场没有安抚情绪,还是中间流程走错了,还是结尾没有确认客户满意?主管的评分是一整块,但员工的失误往往只发生在几个具体瞬间。

这正是训练AI智能体时遇到的真实困境,而这篇来自卡内基梅隆大学和IBM研究院的论文,就是在解决这个问题。

**核心问题:没有标准答案,还想训练得精细**

现在训练AI最流行的一套方法叫强化学习,说白了就是让AI反复尝试,做对了奖励,做错了惩罚,慢慢学会正确的行为模式。这套方法在数学题、写代码这些领域效果拔群,原因很简单:这些任务有客观的对错标准。

> 可验证奖励强化学习(RLVR):一种训练AI的方法,靠程序自动判断AI的输出对不对(比如代码能不能跑通、答案对不对),然后据此给奖励,不需要人工介入打分。

这套方法有个隐藏前提:必须存在一个能自动判断对错的"裁判"。数学题有标准答案,代码有单元测试,这些裁判现成就有。但你让AI去处理客户投诉、去做开放式的市场调研、去操作十几个手机App完成一件复杂的任务,谁来当裁判?没有程序能自动判断"这个客服态度是不是够好"。

论文把这种情况叫做"结果盲区",意思是训练过程中AI永远不知道自己最终是不是把任务做成了,只能靠一些描述性的评判标准来获得反馈。

> 结果盲区(outcome-blind):训练时完全没有办法知道任务最终有没有成功,只能靠对过程的评价来获得奖励信号,这是本文研究的核心场景。

这个设定听起来是不是有点反直觉?毕竟我们平时说AI训练靠"试错",试错的前提难道不是得知道自己错没错吗?但现实中大多数复杂任务恰恰没有这个"知道"的渠道。这才是这篇论文真正棘手的地方。

于是业界想出了一个折中方案,叫做评分标准,英文rubric,说白了就是列一张清单,每条写清楚"做到这点算通过,没做到算失败",然后让另一个AI(通常是能力更强的那个,被称为裁判模型)照着清单给整段表现打分。

> 评分标准(rubric):一套写成文字的评判条目,比如"是否保护了密码不被泄露""是否在任务完成后停止操作",每条对应一个是否满足的判断,用来代替客观对错标准。

问题来了。这些评分标准通常是针对整个任务类型事先写好的,一套标准要覆盖成百上千种具体任务的做法,写得太笼统。而且它只在整段轨迹跑完之后打一次总分,不管这段轨迹有几十步,最后就是一个数字。这就回到了开头那个客服录像的困境:主管打了个总分,但你不知道具体哪一步出了问题。

论文管这个叫"信用分配问题",意思是要把最终的成败正确地归因到具体的每一步行动上。

> 信用分配(credit assignment):把一次任务执行过程最终得到的评价,合理地拆分归因到过程中每一个具体动作上,而不是把整段过程一视同仁地对待。

**为什么均匀分配是浪费,甚至有害**

这里要讲一下现在最流行的一种强化学习训练方式,叫GRPO,全称是"组相对策略优化"。

> GRPO(Group Relative Policy Optimization):一种强化学习训练方法,让AI针对同一个任务生成一组(比如6个)不同的尝试,然后互相比较打分,得分高于平均的尝试会被强化,低于平均的会被抑制。

GRPO的做法是,同一个任务让AI跑好几次,得到一组轨迹,每条轨迹算一个总奖励,然后把这组奖励标准化(减去平均值,除以标准差),得到每条轨迹的"优势值"。优势值为正,说明这次尝试比同组的平均水平强,训练时就会让这次尝试里的每一个动作都变得更容易被复现;优势值为负则相反。

这里的关键问题在于,这个优势值是一个数字,而GRPO把它原封不动地贴到轨迹里的每一个词元(token,可以理解成AI说的每一个字或代码片段)上。一条轨迹如果有几十步,这几十步全部拿到同一个分数。

这就像什么呢?想象你带着五个员工做同一个项目,最后这个项目整体表现比另外一组好,于是你决定给这五个人发一样多的奖金,不管其中某个人其实摸鱼了一整天,另一个人力挽狂澜救了场。如果不区分对待,摸鱼的人下次还会摸鱼,因为他也拿到了奖励;真正立功的人得到的激励却被稀释了。长期这样搞,团队里谁都学不会到底什么才是正确的做法。这不是比喻的修辞游戏,这是论文明确指出的统计浪费,甚至是主动的伤害:成功的轨迹里混杂着运气或者多余的步骤,失败的轨迹里往往大部分步骤其实是对的,只是某一两步出了岔子。

**DRACO的两把钥匙**

论文提出的方法叫DRACO,一个精心设计的缩写,全称是"面向长程智能体训练的动态评分细粒度信用分配"。它用两个核心组件来同时解决前面说的两个难题:没有标准答案怎么打分,以及打完分怎么精细拆分到每一步。

第一把钥匙:让评分标准跟着每次尝试动态生成,而不是一套标准包打天下。

具体怎么做的?对每一个任务,先让裁判模型(论文里用的是GPT-5.4)光看任务说明,生成一批基础评判条目。然后针对AI实际跑出来的每一条轨迹,裁判模型再看一眼这次具体是怎么做的,补充生成这次尝试特有的评判条目,比如这次AI犯了什么之前没预料到的错误、遗漏了什么这次任务才暴露出来的子目标。所有这些从多次尝试里收集来的条目会被合并去重,形成这一组轨迹共享的评分单。

这里有个巧妙的筛选机制,叫"判别性丢弃":一条评判条目,如果这一组里所有尝试都通过了,那就把它扔掉,不计入最终评分。

为什么要扔掉?因为一条大家都能通过的标准,没有任何区分度,留着也是浪费。这就好比考试出题,如果一道题全班都做对了,这道题对区分学生水平毫无帮助,出题老师下次直接换题。DRACO在训练过程中不断地把这种"太简单没有信息量"的条目筛掉,只留下真正能拉开差距的部分。

论文里还发现,如果换成一套写死不变的固定评分标准,会出现一个很明显的问题:训练二十来步之后,AI几乎能通过所有固定条目了,评分标准就"饱和"了,没法再提供进一步的学习信号。而动态生成的评分标准始终维持在66.9%到74.2%的通过率区间,因为它不断针对AI这次具体犯的错误提出新的、更难的挑战。这就好比一个总在出同一套题的老师和一个每次都根据你上次考试暴露的弱点出新题的老师,后者显然能一直逼着你进步,而不是让你考满分之后就原地踏步。

第二把钥匙:把整段的评分拆解,精确落到具体是哪几步做对或做错了。

这里的关键设计是,裁判模型在打分的同时,还要指出"这条评判标准是因为哪几步导致通过或失败的"。有了这个步骤级别的归因信息,论文设计了一套数学规则,把整条轨迹的优势值按权重重新分配到各个步骤上。

具体的分配逻辑是这样的:先算出每一步的"质量分",看这一步被引用的评判条目里,通过的比例是多少。如果这条轨迹整体是"赢家"(优势值为正),那么质量分越高的步骤,分到的正向激励就越多;如果是"输家"(优势值为负),那么质量分越低(也就是被判定表现差)的步骤,分到的抑制力度就越大。评判条目里如果所有引用它的检查都判定失败,这一步在赢家轨迹里的权重就会归零,不会被强化,这正符合直觉:整体虽然赢了,但被明确指出做错的那一步不该被奖励。

这套分配机制有一个重要的数学性质,叫"总量守恒":不管怎么在各步骤间重新分配,加总起来的总激励量和原来GRPO给的一样,只是原来平均撒到每一步,现在集中撒到该撒的地方。论文用整整一个附录(篇幅相当可观)证明了这套规则满足七条形式化性质,包括绝不会把正向激励错误地分配成负向(符号保持不变),以及步骤的总权重不受这一步说了多少话的影响(长度无关性,防止AI靠说废话来骗取更多权重)。

这就好比公司发年终奖,总预算不变,但不再是人人平分,而是按每个人这一年具体贡献的评估结果重新分配,干得好的多拿,拖后腿的少拿甚至不拿,但公司总支出没有变化,只是分配方式变了。如果不这样做,年终奖永远大锅饭,干多干少一个样,团队里真正想拼的人迟早会心灰意冷。

这里还有个值得琢磨的细节。论文发现,这套精细分配机制只有在评分标准是动态生成的时候才真正有用。如果用固定不变的评分标准,因为很快就出现"全员通过"的情况(前面提到的饱和问题),这时候所有步骤的判定都是一致的,分配规则退化成均匀分配,也就是说,这套精细归因的武器,子弹得跟评分标准的动态性配合,才打得出去。数据也验证了这一点:固定标准加上步骤归因,只带来0.8个百分点的提升,而动态标准加上步骤归因,能带来3.2个百分点的提升,两个组件叠加起来的总提升达到4.2个TGC和10.7个SGC。

**实验结果:不用裁判也能打赢用裁判的**

论文在AppWorld这个基准测试上做了验证。这是一个模拟环境,涵盖9个App、457个API接口,AI需要像操作真实手机一样连续执行几十步操作去完成任务,比如"关注我播放列表里所有独立音乐人的歌手账号"。

> AppWorld:一个模拟真实App生态的测试环境,AI需要通过编写代码调用各种App的接口来完成日常任务,用来评估AI智能体在长程复杂任务上的表现。

之前所有在AppWorld上做过强化学习训练的研究,不管用PPO、GRPO还是别的算法变体,全都依赖环境自带的程序化单元测试作为训练奖励。这篇论文是第一个完全不碰这个"标准答案"、纯靠评分标准信号训练出好结果的工作。

具体数据是这样的:在AppWorld的标准测试集上,DRACO把任务完成率(TGC,可以理解成通过单元测试的比例)从未训练时的69.4%提升到85.3%,提升了15.9个百分点;把要求更严格的场景完成率(SGC,指一整套关联任务全部成功才算数)从41.1%提升到70.6%,提升了29.5个百分点,几乎翻倍。

更值得说道的是,拿真正用了标准答案训练的对照组来比,DRACO反而还赢了5.3个百分点的TGC和11.3个百分点的SGC。也就是说,一个完全不知道自己有没有做对的训练方式,最后打赢了一个知道答案的训练方式。这是不是有点违反直觉?按理说有标准答案参照的训练应该更精准才对,但论文的解释是:单元测试给的是一整段轨迹一个二元的对错信号,没有过程细节,而DRACO的评分标准配合步骤归因,能挖掘出比单纯"对/错"丰富得多的中间信息,这些信息反而帮助模型学得更细致。

论文还把DRACO迁移到另一个完全没训练过的场景,叫τ-bench,模拟的是银行客服多轮对话。没在这上面训练过一步,DRACO照样把成功率从15.8%提到20.4%,说明它学到的不是死记硬背某个环境的套路,而是某种更通用的做事方法。

再说一个有意思的对比。论文尝试把裁判模型从昂贵的GPT-5.4换成正在被训练的模型自己(自我打分),结果发现打分成本从每100步训练1607美元降到316美元,省了5倍还多,而且在AppWorld标准测试集上的表现居然超过了用标准答案训练的对照组。但这里也有代价:论文详细分析了自我打分和外部裁判之间的分歧,发现自我打分模型有个明显的偏向,它对"应该判定失败"的条目,有30.4%的概率错误地判成通过,而对"应该判定通过"的条目,只有1.3%的概率错误地判成失败。换句话说,自己给自己打分,容易心软,倾向于放过自己的错误。这个不对称的偏差,随着训练进行还在加剧,从训练前四分之一的22.1%的错误放行率,涨到最后四分之一的34.9%。

这就好比让学生自己批改自己的卷子,他大概率不会故意把对的判成错的(这样对自己没好处),但很可能对模棱两可的地方睁一只眼闭一只眼,久而久之,标准会越来越松。

**一个反直觉的发现:随机奖励居然也有用**

论文里提到一个挺有意思的对照实验。有研究之前发现,用完全随机的奖励信号训练AI,某些情况下居然也能提升性能,这个现象本身就挺让人困惑。论文也做了这个对照,用随机奖励训练出来的模型,在AppWorld标准测试集上达到74.0%的TGC,但DRACO达到85.3%,差了11个百分点还多。这说明随机奖励确实能带来一点提升(可能是某种正则化效应),但DRACO精心设计的信号带来的提升远远不是随机噪声能解释的,两者不是一回事。

**写在后面**

读这篇论文的时候,最触动我的其实不是那套精妙的数学分配公式,虽然它确实设计得很扎实,七条形式化性质证明得也很严谨,而是论文里那个关于"评分标准会饱和"的观察。

固定不变的考核标准,用不了多久AI就能把它摸透,全员满分,考核就失去意义了。这个现象其实完全可以套用到很多我们熟悉的场景上,一套多年不变的KPI体系,一份用了十年的岗位评估表,一个固定不变的产品评审清单。这些东西一开始都能有效区分好坏,但用久了,大家都学会了怎么应付这套标准,标准本身就废了。DRACO的解法是让评分标准本身也跟着"考生"的水平一起进化,这个思路挺值得琢磨的,不只是训练AI,可能对设计任何持续性的评价体系都有启发。

另外一个让我意外的地方是自我打分那部分的发现。裁判模型换成自己之后,居然在"应用给定的评分标准"这个具体环节上表现得相当不错,跟外部裁判的一致率接近九成;但在"自己写出新的评判标准"这个环节上表现很差,只能复现外部裁判大约五分之一的条目。这说明"判断对错"和"提出问题"是两种完全不同的能力,前者可以靠模仿和套用规则完成,后者需要更深的洞察力去发现"这次哪里可能会出问题"。这个区分本身就挺值得单独想一想的。

论文也坦诚地留了一个没解决的问题:评分标准本身写得对不对、公不公正,没有独立的信号可以验证,这需要人类评审员介入才能确认,而论文没有做这件事。裁判模型内部逻辑自洽,不代表它对任务的理解就是对的。这个限制其实指向了一个更大的问题,当我们让AI自己定义什么算"做得好"的时候,谁来监督这个定义本身是不是合理?

这大概是接下来最值得追问的地方。

Q&A

Q1:DRACO是什么?

A:DRACO是卡内基梅隆大学和IBM研究院提出的一种AI智能体训练方法,专门解决没有标准答案时如何精细化训练的问题,核心是动态生成评分标准并把评分精确归因到每一个操作步骤上。

Q2:DRACO训练AI时不需要标准答案吗?

A:是的,DRACO工作在"结果盲区"场景下,训练全程不接触任务是否成功的真实信号,完全依靠裁判模型对过程的评分来提供反馈,这也是它区别于传统强化学习方法的核心特点。

Q3:DRACO的效果比用标准答案训练的方法还好吗?

A:在AppWorld测试中,DRACO比用真实单元测试训练的对照组还高出5.3个百分点的任务完成率和11.3个百分点的场景完成率,尽管它自己完全没有用到那个标准答案信号。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
AI 又干掉一个行业,百人剧组消失,AI 长剧成行业新趋势

AI 又干掉一个行业,百人剧组消失,AI 长剧成行业新趋势

铜臭的历史味
2026-09-17 09:08:25
出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

汉史趣闻
2026-09-01 17:55:01
人民币汇率,重要突破

人民币汇率,重要突破

第一财经资讯
2026-09-18 12:31:51
拿遍所有金牌只缺奥运冠军,28岁世界纪录保持者把目标锁死LA28

拿遍所有金牌只缺奥运冠军,28岁世界纪录保持者把目标锁死LA28

晚风知我意21
2026-09-17 15:14:49
我曾参与死刑执行工作,告诉你一些没人敢说的真相

我曾参与死刑执行工作,告诉你一些没人敢说的真相

水泥土的搞笑
2026-09-18 10:00:56
发布六年的iPhone 12 Pro Max,2026年真实表现,答案因人而异

发布六年的iPhone 12 Pro Max,2026年真实表现,答案因人而异

小柱解说游戏
2026-09-19 01:14:03
日本喊话中方!
2026年9月17日,田母神俊雄说中国要求高市早苗收回"涉台言论"是"干涉日本内政",还放话绝不妥协

日本喊话中方! 2026年9月17日,田母神俊雄说中国要求高市早苗收回"涉台言论"是"干涉日本内政",还放话绝不妥协

扶苏聊历史
2026-09-17 18:32:27
2027年将会是中华人民共和国全党、全军、全国各族人民重要的一年

2027年将会是中华人民共和国全党、全军、全国各族人民重要的一年

铁锤侃侃而谈
2026-09-12 00:54:59
吴艳妮鸣枪前举手中断比赛被罚黄牌,仍13秒12夺得女子100米栏冠军,实现全锦赛三连冠、加冕六金王

吴艳妮鸣枪前举手中断比赛被罚黄牌,仍13秒12夺得女子100米栏冠军,实现全锦赛三连冠、加冕六金王

都市快报橙柿互动
2026-08-16 23:07:30
有钱!日本一男子匿名向兵库县捐了35公斤黄金,价值约8.3亿日元

有钱!日本一男子匿名向兵库县捐了35公斤黄金,价值约8.3亿日元

日本窗
2026-09-17 20:08:21
离谱到家!俄电商将军用物资伪装成儿童玩具,翻车被炸纯属活该

离谱到家!俄电商将军用物资伪装成儿童玩具,翻车被炸纯属活该

老马拉车莫少装
2026-08-23 11:18:30
从幼师到演员,出道20年,孔令美凭《兰香如故》走红,又美又强!

从幼师到演员,出道20年,孔令美凭《兰香如故》走红,又美又强!

娱人细品
2026-09-17 21:33:32
76年毛主席逝世后,华国锋明确要求在悼词中加一句话,叶帅:我赞同

76年毛主席逝世后,华国锋明确要求在悼词中加一句话,叶帅:我赞同

微野谈写作
2026-09-18 15:50:05
“我太痛苦了,回家吧”,一位母亲从看病到离世仅14天,儿子视频记录她从“铿锵有力”到天人永隔,看哭网友,当事人发声

“我太痛苦了,回家吧”,一位母亲从看病到离世仅14天,儿子视频记录她从“铿锵有力”到天人永隔,看哭网友,当事人发声

鲁中晨报
2026-09-18 11:35:19
贾乃亮李小璐世纪和解,炸出大瓜!

贾乃亮李小璐世纪和解,炸出大瓜!

互联网品牌官
2026-09-16 12:02:46
43岁前尼克斯乐透秀离世,他曾是乔治城传奇内线

43岁前尼克斯乐透秀离世,他曾是乔治城传奇内线

林间小温柔
2026-09-19 01:17:14
郑丽文胆子真大!她曾直接放出话来,如果自己当了国民党主席

郑丽文胆子真大!她曾直接放出话来,如果自己当了国民党主席

叶葉夜
2026-08-21 21:27:57
俄兵单日损失破纪录,美通过最严厉对俄制裁法案

俄兵单日损失破纪录,美通过最严厉对俄制裁法案

名人苟或
2026-09-17 14:11:15
房价拐点终究还是来了?国家首次正式承认房地产出现一个重大变化

房价拐点终究还是来了?国家首次正式承认房地产出现一个重大变化

专业聊房君
2026-09-16 19:32:09
中国男篮惨败之后的尴尬:胡明轩还作为旗手参加开幕式吗

中国男篮惨败之后的尴尬:胡明轩还作为旗手参加开幕式吗

姜大叔侃球
2026-09-18 20:44:03
2026-09-19 02:08:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4820243文章数 9643关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

游戏
家居
本地
数码
军事航空

《给他爱5》废弃“自由城”DLC可能会加入到《GTA6》中

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

数码要闻

Realforce静电容键盘GX1 Plus皮卡丘版亮相TGS2026

军事要闻

中方反对在安理会强推恢复对伊朗制裁

无障碍浏览 进入关怀版