![]()
你有没有教过小孩骑自行车?
如果你在后面一直扶着车座,孩子永远学不会平衡。如果你一开始就完全放手,孩子摔一次就再也不肯骑了。真正管用的做法是,扶一段路,然后松手让他自己骑一小段,摔了再扶一下。松手的那个"度",不多不少,才是学习真正发生的地方。
这篇论文讨论的问题,本质上就是这个"松手松到什么程度"的问题,只不过对象换成了正在学习完成复杂任务的AI智能体。
**这件事难在哪**
先说清楚背景。现在训练AI智能体(比如让它在虚拟房间里捡东西、在网上买东西)常用一种叫强化学习的方法,简单说就是让AI自己不断尝试,做对了给奖励,做错了没奖励,靠这个信号慢慢学会怎么做事。
强化学习*:一种让AI通过反复试错、根据结果好坏调整自己行为的训练方式,跟训练宠物做动作类似,做对了给零食,做错了不给。
问题出在哪里?这类任务往往要走十几步甚至几十步才能知道成不成功,中间每一步都没有反馈。你让AI从零开始瞎试,它大概率永远走不到成功的那一步,连续几十步全靠猜,成功率几乎是零。论文里提到,在这种情况下,策略几乎不可能靠自己摸到成功的终点状态。
研究者们想出的办法叫"提示引导",英文叫hint-based RL。思路很简单:既然AI自己走不到终点附近,那就先给它看一段"专家走过的路",让AI从半路开始接着走,这样它离成功近了,更容易撞上正确答案,也就更容易学到东西。
专家轨迹*:由人类或更强模型提前示范好的一整套完整操作步骤,比如"先开冰箱、拿出苹果、放进锅里、开火"这样一条完整的成功路径。
这个思路听起来挺合理,但马上冒出一个新问题:这段"专家路"该给多少?给太少,AI还是走不到终点附近,等于没给;给太多,AI几乎是原样抄完专家的操作直接成功,它自己什么都没学到,因为奖励变得太容易拿,没有对比性,它分不清哪一步做得好哪一步做得差。
论文里管这个"给多少"叫引导深度。这个深度定得不好,训练效果就大打折扣,这正是整篇论文要解决的核心矛盾。
**已有方法都卡在哪儿**
在Agent-G?之前,业界大致分两条路。
第一条路叫schedule-based,也就是按训练进度定一个统一的深度。比如训练刚开始给多一点提示,随着训练进行逐渐减少提示,用一条曲线(线性下降、余弦下降、阶梯下降)来控制。这类方法的问题很直接:整批任务共用同一个深度值,完全不管每个任务本身有多难。
论文举了个特别形象的例子:在ALFWorld这个虚拟家居环境里,"捡一个东西"可能只需要两步,"捡两个东西"却要走二十步。用同一个深度去套这两种任务,简单任务给多了浪费,难任务给少了根本不够。论文用实际数据验证了这个问题的严重性,他们测试的几种按进度调整的方法,把提示分配到"有效区间"里的比例只有15%到23%,剩下六成以上的分配都是过多或过少,属于无效引导。就连表现最好的那种(根据批次准确率动态调整的方法),也有38%的分配落在无效区间外。
第二条路叫per-sample probing,给每个任务单独测试出最合适的深度。做法是先在几个候选深度上各跑几次,看哪个深度让成功率最接近50%(因为50%成功率意味着"半懂不懂",正是学习信号最强的地方),选中它作为这个任务的深度。这个方法确实更精准,但代价是要多跑很多次探测性的实验。论文的数据显示,如果每个候选深度只跑2次去探测,用二分搜索的方法依然有75%的任务被分配错了深度;想要把错误率降到接近于零,得每个候选深度跑32次,探测成本是正常训练的20倍。
这就好比找钥匙掉在了哪个房间。一种办法是随便猜一个房间去翻箱倒柜,翻错了大概率还得再来一次;另一种办法是每个房间都仔细搜一遍,肯定能找到,可是这样一来找钥匙的时间比开门出去要用的时间还长得多。如果不多花时间去精确定位,就找不准;如果花时间精确定位,代价又太大,成本会失控。这正是per-sample probing面临的两难。
**藏在数据里的真相:最佳深度根本不是一个点**
论文作者做了一件很扎实的诊断工作,他们想搞清楚,"有效的引导深度"到底长什么样。
他们在ALFWorld环境里,针对每一个任务,把好几个候选深度都跑了32次,统计每个深度对应的成功率。结果发现一个特别关键的现象:能让训练最有效的深度,不是孤零零的一个值,而是一整片区域。
论文里画了一张图,横轴是不同的引导深度,纵轴是成功率,可以看到成功率并不是在某个深度突然从0跳到1,而是像坡度一样缓慢爬升再缓慢下降,中间那一片"半懂不懂"(成功率在0.4到0.6之间)的区域,往往覆盖好几个相邻的深度值,不是单一的一个数字。
更进一步,他们把训练信号的强弱(用伯努利方差衡量,成功率越接近50%这个值越大)按"相对最佳深度的偏移量"对齐后画出来,发现这条曲线长得几乎就是一个正态分布(也就是常说的"钟形曲线"),拟合出来的标准差是0.22,拟合优度R?达到0.92,说明这个钟形分布的形态非常吻合。
这个发现推翻了此前所有方法的一个隐藏假设,就是"每个任务存在唯一的最佳深度,任务是要把它找出来"。而事实是,有效深度是一整个邻域,而不是一个孤立的点。就像找一个人能不能听清楚你说话的最佳距离,不是精确到毫米的某一个数字,而是一米到三米之间都能听得清楚,你没必要非要量出精确的那一个数字,只要站在这个区间里就行。
如果继续把这个"区间"问题当成"单点定位"问题来解决,自然会撞上前面说的两条路的困境:统一深度覆盖不了区间的差异性,per-sample探测又为了精确定位单点付出了本不必要的成本。真正该做的不是更精确地定位一个点,而是让引导深度本身变成一个可以覆盖那片区间的分布。
**Agent-G?的做法:把"给多少提示"变成一个概率分布**
这就是Agent-G?的核心创新。它不再给每个任务分配一个固定的深度数字,而是给每个任务分配一个高斯分布(也就是正态分布),深度值从这个分布里随机抽一个出来用。
高斯分布*:就是那个经典的钟形曲线,中间概率最高,两边逐渐降低,抽样时大概率抽到中间附近的值,偶尔也会抽到稍远一点的值。
关键在于这个分布的两个参数(中心位置和分散程度)怎么定。论文设计了一套"全局加局部"的估算办法,完全从已经跑出来的训练数据里现算,不需要额外多跑一次实验去专门探测。
具体来说,系统维护一个全局基线,追踪整体训练进度处于什么水平。如果这批任务整体成功率偏低,说明当前策略还比较弱,就把全局基线往"提示更深"的方向调;如果整体成功率偏高,说明策略已经不错了,就往"提示更浅"的方向调。
同时,系统把所有任务按专家轨迹长度(也就是任务本身的复杂程度)离线分成几个簇(论文里分成短、中、长三类),对每个簇单独维护两个统计量:这个簇当前的平均成功率,以及这个簇内部成功率的波动程度。簇内成功率越低,说明这类任务偏难,中心就往更深的引导方向偏移;簇内波动越大,说明簇里任务的难度参差不齐,分布的散布程度就调宽一些,让抽样能覆盖更宽的范围。
拿一个具体场景来说明这套机制。假设"长任务"这个簇(比如需要捡两个东西再放进冰箱这种二十步任务)本身内部差异很大,有些变体接近简单任务的难度,有些则特别绕。如果强行给这个簇一个固定深度,就会出现前面说的问题:某些子任务提示够了但另一些还差得远。而Agent-G?通过把这个簇的分布调得更宽,让抽样结果本身自然覆盖到簇内的不同难度层次,某次抽样给深提示,某次抽样给浅提示,整体上就能兼顾簇内的差异性。如果不这么做,簇内差异越大的任务群体,效果损失就越明显,论文的实验后面会证实这一点。
每个任务确定好分布后,就从这个分布里抽一个具体的深度值,转换成对应的提示步数,让所有的实验重复都从这个统一的"半路起点"出发继续探索。而这批实验跑出来的结果,又反过来更新前面提到的那些统计量,进入下一轮循环。整个过程不需要额外的探测性实验,也不需要训练一个专门的深度预测模型,所有需要的信息都是正常训练过程中本来就会产生的副产品。
这套机制最巧妙的地方在于,它把"探测成本"和"覆盖不到位"这两个此前互相矛盾的问题同时解决了。不用额外跑实验去精确定位,因为压根不需要精确定位一个点;覆盖面又足够宽,因为分布本身就是设计用来覆盖那片有效区间的。
**训练效果:数字说话**
论文在ALFWorld(虚拟家居任务)和WebShop(网购任务)两个环境上,分别用1.5B和7B两种规模的Qwen2.5模型做了实验。
在ALFWorld上,Agent-G?在1.5B规模下整体成功率达到95.3%,在7B规模下达到98.4%。相比之下,最强的按进度调整方法(Target-acc)在两个规模下分别是93.8%和92.9%,最强的探测式方法(Enumeration)分别是86.0%和96.1%,最强的辅助监督类方法(RLVMR)分别是87.9%和91.8%。Agent-G?全面超越了这些对手,且随着模型规模从1.5B变大到7B,它的领先优势没有缩小反而从1.5个百分点扩大到2.3个百分点,说明这套方法不会因为模型变强就失效。
在WebShop上,Agent-G?在两个规模下都拿到了92.3的奖励分数,最终购买成功率分别是78.9%和84.4%,同样是所有不依赖额外探测的方法中最强的。
有一个特别值得说的细节。1.5B规模的Agent-G?,效果居然超过了7B规模的另一个基线方法BEACON(91.4%)。这意味着一个更小的模型,配合更聪明的引导策略,能打过一个更大的模型配合普通策略。这说明调度设计这件事本身,价值可以等价于把模型规模做大,不是可有可无的辅助优化。
论文还专门做了个对照实验,证明这个提升不是靠"抄专家答案"取巧得来的。他们试了纯粹靠模仿专家完整轨迹训练的模型(Full SFT),成功率只有56.3%;只在Agent-G?训练过程中采样到的那些提示片段上做模仿训练的模型(Sampled-Prefix SFT),成功率更低,只有26.6%。而Agent-G?本身是95.3%,中间差了68.7个百分点。这个巨大的差距说明,真正起作用的不是模仿了多少专家的操作,而是AI在"从提示末尾接着走"这个后续探索阶段学到的东西,模仿只是打底,强化学习才是主力。
再看训练速度。论文对比了达到同等准确率所需的训练步数,Agent-G?比表现最好的固定调度方法快了大约一倍。虽然Agent-G?每一步训练的耗时比简单调度方法略高(88秒对57到80秒),但相比探测式方法(285到425秒,是Agent-G?的3.24到4.83倍)依然便宜得多。综合收敛速度和单步成本,Agent-G?的整体训练效率是所有方法里最优的。
**拆解一下:中心和散布分别管什么**
论文做了细致的消融实验,把Agent-G?拆开看每个部件到底贡献了多少。
如果去掉随机抽样这一步,每个任务直接用分布的中心值当固定深度(相当于退化成一个确定性调度器),整体成功率从95.3%掉到89.8%,降了5.5个百分点。这证明单点估计确实覆盖不了那片有效区间,随机性本身就是价值所在。
如果把高斯分布换成方差匹配的均匀分布(也就是抽样范围内每个值概率相等,不再是中间高两边低),成功率降到88.3%,说明抽样要覆盖区间没错,但呈钟形分布地覆盖比平均地覆盖效果更好,跟前面观察到的信号强度本身就是钟形分布这一点是吻合的。
如果去掉按簇调整中心的机制,所有任务共用一个全局中心,成功率降到91.4%。如果去掉按簇调整散布宽度的机制,成功率降到93.8%,其中长任务这个簇的成功率单独从94.7%暴跌到78.3%,跌幅特别大。这说明长任务这类难度参差不齐的任务群体,恰恰最依赖分布宽度的自适应调整,一旦分布宽度固定住不能变,最先受伤的就是这类任务。
如果把所有任务全部塞进一个簇,不做任何区分,成功率降到89.1%,长任务的成功率单独暴跌29.3个百分点。这几乎证实了论文开头提出的观察:任务难度差异巨大是agentic任务区别于数学推理这类任务的核心特征,忽略这种差异性会带来实实在在的性能损失。
**关于聚类方式的补充实验**
论文额外做了一组实验,看聚类数量和聚类依据本身对结果的影响。
结果显示,按专家轨迹长度分成3类和分成5类效果基本相当(分别是95.3%和96.5%,在实验的误差范围内难分高下),但如果分成10类,每个批次里每一类平均分不到两个任务,统计量根本没法稳定估计,成功率反而跌到86.2%。而如果完全随机地把任务分成3组(不按任何难度信号),成功率只有89.4%,跟完全不分组的89.1%几乎没差别。
这说明分组这件事本身不产生价值,真正产生价值的是分组依据要和任务难度对齐。论文选择用轨迹长度这个简单指标来分组,原因也很朴素:轨迹长度天然跟"不给提示能不能靠自己摸到成功"这件事的难度相关,而且不需要额外的人工标注或语义理解,同一套规则可以直接套用到不同的任务环境上。
**写在后面**
读完这篇论文,最让我停下来想了很久的一点是,这里面藏着一个更普遍的道理:很多"最优参数"类问题,可能压根不该被当成寻找单点最优解的问题。
平时做技术选型或者调参的时候,很容易陷入一种思维定势,觉得一定存在唯一的"最佳值",任务就是想办法逼近它。但这篇论文用扎实的数据证明,至少在这个场景下,有效区间是一片而不是一个点,把寻找单点的精力,不如用来把这片区间摸清楚,然后设计一个机制让系统自然落在这片区间里。
另一个让我觉得挺妙的地方是,这套方法完全不需要额外的探测成本,所有的统计量都是训练本身产生的副产品。这其实是一种"零成本感知环境状态"的思路,系统一直在自然产生的数据里,藏着足够的信息去指导下一步该怎么调整,只是需要有人愿意把这些信息利用起来,而不是又去跑一遍额外的实验来单独测量。
这让我想起一个不完全相关但感觉上有点像的场景。有些好的管理者不需要专门开会去"了解团队状态",因为日常汇报、代码提交、消息回复速度里已经藏着足够的信号,只是大部分人选择性忽略了这些免费的信息,反而去搞额外的绩效考核。信息可能一直都在那儿,缺的往往不是数据,而是把数据用起来的那套机制。
论文里没细谈的一点是,如果任务的难度分布本身是双峰的(比如某类任务有明显的"简单变体"和"困难变体",中间没有过渡),钟形分布这个假设会不会失效?论文自己也承认了这一点,说这属于开放方向。这个问题留着,也许下一篇论文会给出答案。
Q&A
Q1:Agent-G?是什么?
A:Agent-G?是一种给AI智能体训练用的引导深度分配方法,它不再给每个任务固定一个提示深度,而是从一个高斯分布里随机抽取,这个分布的中心和宽度都从已有的训练数据里在线估算出来,不需要额外探测实验。
Q2:Agent-G?和传统的按进度调整提示深度方法有什么区别?
A:传统方法给整批任务用同一个提示深度,忽略了任务难度差异;Agent-G?给每个任务单独分配一个概率分布,还会按任务簇的难度和波动程度动态调整分布的中心和宽度,能覆盖不同难度任务各自的有效区间。
Q3:Agent-G?的效果比其他方法好多少?
A:在ALFWorld环境下,Agent-G?整体成功率达到95.3%(1.5B模型)和98.4%(7B模型),比最强的探测式方法和辅助监督方法都高出好几个百分点,同时训练成本只有探测式方法的三分之一左右。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.