![]()
这项由PrismShadow与纽约大学共同完成的研究,以预印本形式发布于2026年8月,论文编号为arXiv:2608.03764,发表日期为2026年8月5日。感兴趣的读者可以通过该编号查询完整原文。
假设你刚刚入职一家新公司,需要处理客户投诉。第一天,你可能手忙脚乱,因为你不知道公司的规定:哪些客户能享受退款、哪些故障需要上报、哪个部门负责哪类问题。但经过一周的实际操作,你慢慢摸索出了规律,开始举一反三。到了第二周,即便遇到从未见过的新案例,你也能凭借积累的经验快速做出正确判断。
这正是AI研究者一直梦想让机器实现的能力——让AI智能体像新员工一样,通过处理真实工作任务来"学习成长",而不是每次遇到新问题都从零开始。这种能力被研究者称为"智能体自我进化"。然而,要科学地评估AI到底学没学会、学了多少,需要一套专门设计的考试体系,而这套体系恰恰是当前AI领域最缺乏的东西。
PrismShadow的研究团队为此构建了一个名为GDPevo的评测基准,这是目前第一个专门针对真实经济价值型工作任务来评估AI自我进化能力的系统。它覆盖了客户关系管理、企业资源规划、金融、医疗、法律以及数据分析等六大行业领域,包含240道精心设计的任务题目。更重要的是,整个基准的生成过程几乎完全由AI自动完成,能够在两天内快速更新,有效应对"题目泄露"的问题。
一、为什么现有的AI考试体系不够用
要理解GDPevo解决了什么问题,先要弄清楚现有体系的缺陷在哪里。
目前,用于评估AI自我进化的基准大致分为两类。第一类称为"进化原生基准",这类基准专门为测试AI的学习迁移能力而设计,训练题和测试题之间存在刻意安排的关联关系——AI在做训练题时学到的知识,必须在做测试题时用上。然而这类基准普遍存在覆盖面窄的问题,它们往往只涉及一些相对简单、经济价值不高的任务,很少触及发票审计、合规检查、病历核对这类真正有商业意义的复杂工作。
第二类称为"进化自适应基准",这类基准直接把原本为其他目的设计的任务集(比如软件工程问题库、交互推理环境)拆成训练集和测试集来使用。这种做法的优点是任务更丰富、难度更大,但致命缺陷在于:训练集和测试集之间的关系是随机切割出来的,根本没有经过专门设计,所以即便AI在测试时表现变好了,也无法确定这种进步究竟是因为它真正"学会了什么",还是纯属运气。
两类基准还共同面临一个老大难问题:题目一旦公开就面临"泄露"风险。现在的大语言模型训练数据极其庞大,很可能已经"见过"这些题目,就像一个学生偷偷背了答案再去考试,成绩自然好看,但这并不能说明他真正学会了。
GDPevo的研究团队把这三个问题看得非常清楚,并且针对每一个都设计了具体的解决方案。
二、这套考试是怎么设计出来的
GDPevo的核心设计思路是用一条完全自动化的流水线来生成题目,整个过程分三个阶段。
第一阶段叫"种子场景发现"。研究团队从现有的真实工作类基准(如GDPval、SOP-Bench、JobBench等)中提取了大量真实职场场景作为原材料。他们让AI筛选助手根据三条标准来筛选:场景必须包含领域特定的隐藏规则、这些规则必须能被精确验证、场景必须足够复杂以支持一套完整的标准操作流程。比如"服务工单处理"这个场景——AI需要验证客户账户状态、诊断故障、执行维修操作,并记录最终处置结果。这个场景里藏着很多企业特有的规则:哪些账户状态有资格获得支持、哪些诊断读数构成故障、哪些故障必须上报以及上报给哪个团队。
第二阶段叫"任务组生成",这是整个设计中最关键的部分。研究团队为此发明了一种叫作"规则杂交"的机制。具体来说,每个场景包含若干条原子规则——这些规则是企业内部独有的、不属于AI通用世界知识的业务规定,比如某公司的赞助商优先级策略、某公司的黑名单排除规定、某公司的发票有效期设定。规则杂交的做法是:把这些规则拆散,分别"种"进五道训练题里,让每道训练题只暴露其中一部分规则;然后把这些规则重新组合,分布到五道测试题里,而且测试题中的规则组合方式与训练题完全不同。
打个比方,假设一家公司有四条规则:优先级规则、黑名单规则、折扣规则、截止日期规则。训练题一涉及优先级和折扣,训练题二涉及黑名单和截止日期,训练题三涉及优先级和黑名单……如此分散。而测试题则可能同时需要综合运用优先级、黑名单和折扣这三条规则——这种组合在任何一道训练题中都没有出现过。只有真正把每条规则学透的AI,才能在测试时举一反三,正确应对全新的组合情况。
第三阶段叫"校准与独立审查"。校准过程要求AI在不接受任何训练的情况下直接做测试题,得分应该在40%到60%之间——太高说明AI靠常识就能答对,没有学习的必要;太低说明题目太难,根本无从下手。接着,给AI看训练题答案后再做测试,得分提升幅度应在10到30个百分点之间——太小说明训练题没有可学的东西,太大说明测试题太简单。此外,即便经过学习,得分也应保持在80%以下,确保还有继续进步的空间。
审查环节则由六个独立的AI审查员分别检查每一组任务,只有至少五个审查员投票通过,这组任务才能被收录。审查的重点包括三个方面:所有必要的文件和评分脚本是否完整(AI在生成内容时有时会"偷懒",宣称完成但实际留有缺口);评分标准是否清晰、多样,各题之间不过于雷同;标准答案是否与题目文件严格隔离,不存在任何形式的答案泄露。
整个流程完全由AI自动运行,研究人员唯一的人工介入是在最开始提供那批现实职场基准作为原材料。正因如此,当某个版本的题目面临泄露风险时,团队可以在两天内重新生成一套全新的题目,GDPevo的V1版本包含120道题、12个任务组,V2版本同样包含120道题、12个任务组,两者合并形成包含240道题、24个任务组、覆盖六大领域的完整基准。
三、考试规则是怎么制定的
了解了题目是怎么出的,再来看看这套考试是怎么进行的。
研究团队把"智能体"定义为"执行框架"加"语言模型"的组合。执行框架负责工具调用、上下文管理、技能加载和执行控制,相当于AI的"行动系统";语言模型提供底层推理策略,相当于AI的"思考系统"。研究中使用了Codex和Claude Code两种执行框架,以及GPT-5.5、Opus-4.8、GLM-5.2和DeepSeek-V4-Pro-Preview四种语言模型,组合形成四种完整的智能体配置。
每种智能体会在四种不同的"学习条件"下接受测试,研究团队称之为"监督类型"。第一种叫"基线",AI不接受任何训练,直接上手做测试题,相当于新员工第一天就独自上岗。第二种叫"少样本监督",AI能看到五道训练题的题目和标准答案,从中总结出可复用的经验技能,再去做测试题——这类似于监督学习,AI相当于一个认真研读了员工手册的新人。第三种叫"反思式监督",AI同样处理五道训练题,但不给标准答案,只告诉它每次尝试的得分,让它自己反思改进,循环三轮——这类似于强化学习,AI相当于一个通过反复犯错来摸索规律的实习生。第四种叫"自主监督",AI只能看到训练题题目,连得分反馈都没有,只能通过探索题目环境(比如查看数据库里有哪些字段)来积累经验——这类似于无监督学习。
在进化方式上,所有实验都采用"技能库"机制:AI处理训练任务后,会把学到的经验整理成一份名为SKILL.md的文档,记录可迁移的业务规则、环境操作方法、输出格式规范和常见失败模式;新的AI实例加载这份文档后,再去处理测试任务。
评分同样经过精心设计。研究团队刻意不使用"让另一个AI来打分"的方式,而是让AI把每一条评分标准转换成可执行的代码测试,每条标准要么全对要么全错,没有灰色地带,这样评分结果完全可以复现,每一处失分也能追溯到具体的哪条规则没有满足。每道测试题都会独立运行三次,最终取三次的平均分,以减少随机波动的影响。
为了确保实验的公平性,每次运行都在独立的Docker容器中进行,容器只能访问该阶段被允许的文件,无法读取答案文件、评分脚本或其他任务的痕迹,训练阶段和测试阶段的数据严格隔离。
四、AI学习了之后,成绩提高了多少
实验结果从多个维度给出了答案。
以最直观的准确率来看,四种智能体在少样本监督下的表现均优于其他任何学习条件。具体来说,Codex框架加GPT-5.5的基线准确率为49.37%,经过少样本监督进化后提升至64.51%,提高了15.14个百分点。Opus-4.8加Claude Code的基线为50.63%,经过少样本监督后跃升至67.07%,提高了16.44个百分点,是所有组合中进步幅度最大的。GLM-5.2加Claude Code从46.12%提升到60.09%,进步13.97个百分点。DeepSeek-V4-Pro-Preview加Claude Code从43.58%提升到48.79%,提高了5.21个百分点。
这里有一个出乎意料的发现:基线得分低的AI,进步幅度并不一定更大。DeepSeek-V4-Pro-Preview的基线得分最低,但进步幅度反而最小;而Opus-4.8的基线得分最高,进步幅度却最大。这说明AI的自我进化能力和它最初的"起点"关系不大,更多取决于模型本身的推理能力。
进化不仅能让AI答题更准确,还能让它做题更高效。GPT-5.5经过少样本监督后,测试时的单题费用从1.29美元降低到1.02美元,节省了约21%,同时准确率大幅提升。这意味着AI不仅学会了正确答题,还学会了更有针对性地查找信息,减少了不必要的"绕圈子"探索。比如在工程运营分析任务中,少样本监督版本的GPT-5.5平均每道题大约使用15.53次工具调用,而基线版本平均约需30次——学过之后,AI知道去哪里找关键信息,不再漫无目的地搜索。
研究团队还设置了一个"上限参考线":给AI提供所有隐藏规则加上训练题的完整信息,同时配合人类操作员共同完成测试任务,这种条件下的得分为91.6%。这个数字代表了理论上一个完全掌握所有规则的理想智能体应该能达到的水平。现实中表现最好的进化后AI是Opus-4.8的少样本监督版本,得分67.07%,距离91.6%的上限还有超过24个百分点的差距。这说明当前AI的自我进化能力确实得到了实质性提升,但距离真正"融会贯通"还有相当大的空间。
五、从一个领域学到的,能用在另一个领域吗
上面的实验都是在同一个领域内学习和测试,研究团队进一步想知道:如果AI在客户关系管理领域学习,学到的经验能帮助它处理企业资源规划的任务吗?
为了回答这个问题,研究团队选取了客户关系管理、企业资源规划和金融三个领域各一个任务组,让AI在其中一个领域学习后,分别在三个领域接受测试,得到了一张3×3的"迁移效果矩阵"。
实验揭示了三条规律。首先,在同一领域内学习和测试的效果始终最好,这是意料之中的结果,与其他实验的结论一致。其次,少样本监督的跨领域迁移表现很不稳定,六个"跨领域"格子里有五个是负值,最差的情况出现在用金融数据训练后去做企业资源规划任务,准确率反而下降了5个百分点。这种行为与机器学习中的"过拟合"非常相似——AI在少样本监督下死记了金融领域的规则,结果这些规则在其他领域不仅帮不上忙,还会干扰正确判断。
反思式监督的表现则截然不同。它的跨领域迁移效果要温和得多,六个跨领域格子里有三个是正值,最高的情况是用企业资源规划数据训练后去做金融任务,准确率提高了6.5个百分点,而最差的情况也不过下降1个百分点。这种模式类似于强化学习训练出的模型——通过反复尝试获得反馈,AI学到的更多是可以跨场景应用的通用推理方式,而不是特定领域的具体答案。
更有意思的是,反思式监督下同领域学习的优势消失了:用客户关系管理数据训练后,对金融任务的帮助(提高5.9个百分点)竟然超过了对客户关系管理本身的帮助(仅提高2.6个百分点)。这暗示反思式学习产生的技能更具通用性,虽然牺牲了一些领域内的专精度,但换来了更强的跨领域适应性。
六、进化方法重要,还是模型本身重要
研究还探讨了一个很有实践意义的问题:要提升AI的自我进化效果,应该把精力放在改进"技能提炼方法"上,还是直接换一个更聪明的模型?
为了回答这个问题,研究团队固定了智能体配置和学习条件(均为少样本监督),只更换"技能创建器"这一个变量。技能创建器是把训练经验转化为SKILL.md文档的那个组件,研究团队对比了五种不同的实现方式:一种是研究团队自己写的极简基线版本(只有一句话:"请把经验总结成技能"),另外四种分别是Claude Code、Codex、OpenCode和deepagents的内置技能创建器。
结果令人意外:最简单的极简基线版本不仅没有垫底,在GPT-5.5上反而是五种方法里表现最好的,提升幅度高达15.46个百分点,超过了所有精心设计的复杂技能创建器。在DeepSeek-V4-Pro-Preview上,各种技能创建器的效果差异也很小,最好和最差之间只相差约1.3个百分点。这说明技能创建器的精细程度对最终结果影响甚微,进化效果的大小主要取决于模型本身的推理智能水平。换句话说,给AI配备更聪明的大脑,远比给它设计更复杂的学习方法来得有效。
七、AI到底是真的学会了,还是在耍小聪明
光看数字还不够,研究团队深入分析了四个具体的任务组案例,来理解AI在自我进化中究竟学到了什么,又在哪里出了问题。
第一个案例是工程运营分析任务组。AI需要处理包含工作项目、团队、状态、里程碑、阻碍因素等信息的复杂数据库,完成投资组合分析、延迟工单审计、发布就绪性评估等任务。经过少样本监督,GPT-5.5的得分从51.16%跃升至80.21%。深入分析发现,AI真正学会了一套条件决策链:先验证记录的有效性,再按业务含义建立分析对象池,分类后才进行计算,最终只针对能改变最终决策的风险因素采取行动。例如在一道题中,数据库里有九个项目,但必须先剔除已取消和重复的项目才能得到正确的分析对象;在另一道题中,九个未完成的工作项里只有四个包含高影响力阻碍因素,真正阻止发布的只是这四个,其余五个只需监控。AI学会了区分"真正的发布阻碍"和"普通的未完成工作",而不是把所有未完成项目一视同仁。
第二个案例是医疗保险运营任务组。任务覆盖治疗授权、药物拒付申诉、工伤赔偿重新计算、医生同行评审等多种工作流程。AI需要不仅选择正确的操作,还要提供区分支持性记录、缺失记录和排除记录的完整审计轨迹。三种学习条件下,AI均超过了51%的基线。分析表明,AI学到了两条可跨任务迁移的规则:一是要精确命名具体缺失的材料,而不是泛泛描述一类文件;二是基于结构化因素为授权决策提供依据,而不是依赖叙述性表述。这些规则不依附于特定的患者、药品或赔偿项目,能够普遍适用。
第三个案例展示了负向迁移。在法庭行政案件处理任务组中,AI需要核对案件记录、确定处置状态、计算费用、安排付款计划,其中管辖权、处理日期、申请类型和案件状态都是会改变多个后续输出的关键条件。DeepSeek-V4-Pro-Preview经过少样本监督后,准确率从48.36%反而下降到39.83%。根本原因在于AI把训练案例中的局部规律当成了普遍规律:某个数据源对某类事实是权威的,被误解为对所有事实都权威;训练答案中几次没有出现的费用,被记成了"永远不收费";相差约30天的两个日期,被当成了标准截止期限规则。这些"经验"在训练案例中成立,但一旦管辖权或案件状态改变,就会导致严重错误。在一道测试题中,案件LC-25-0331处于"继续审理"状态,没有最终裁定,不能提前关闭或收费,但AI的技能文件引导它按"已完结"案件处理,导致处置状态、财务条目、系统操作和文件全部出错,该题得分仅17.78%,而基线版本得分40%。
第四个案例展示了有限迁移。临床分诊任务组要求AI读取当前患者数据和运行时协议,填写包含风险等级、用药方案、检测项目、随访时间和证据标识符的结构化处置表。与其他案例不同的是,这个任务组的很多关键决策阈值已经直接写在运行时协议里,不需要从训练题中学习,因此训练经验能提供的额外价值本就有限。结果是三种学习条件下均未能超过64.25%的基线。AI学到了一些局部规则,比如某种肺炎场景下推荐的检测组合,但这些只覆盖了很小一部分评分点,无法影响急诊处置决策、风险标签或证据标识符。更糟的是,当学到的特定时间值脱离了其适用的临床分支条件被单独应用时,还会覆盖运行时协议中的正确答案。
这四个案例共同揭示了一套有效技能迁移的三个前提条件:训练任务中必须包含可复用的结构性规律;生成的技能必须保留规则的适用条件,而不仅仅记录规则的结论;技能必须明确每条证据控制哪些输出字段。一份只记录"做什么"而忘记"在什么条件下做"的技能,很可能比没有技能还要糟糕。
八、打造这套考试系统,踩了哪些坑
在构建这24组任务的过程中,研究团队积累了大量实践经验,总结出了若干对后来者很有价值的工程教训。
关于训练和测试关系的设计,两个极端都会导致结论失效:如果训练题直接示范了测试题的做法,AI的进步可能只是模板复制,不代表真正的学习;如果训练和测试完全无关,即便AI没有进步也不能说明它不能进化,只能说明这套考试没有给它提供任何有用的学习材料。因此,必须从设计之初就明确指定哪些测试评分点在训练任务中有对应的锚点,以及什么知识会迁移、什么内容在测试时会发生变化。
关于信息隔离,依靠提示词"要求AI不要查看答案"是靠不住的。不同的AI框架有不同的文件探索习惯,有些会主动扫描目录,有些不会。唯一可靠的方式是用Docker容器来严格控制每个阶段可以挂载哪些文件,让文件访问权限从物理层面匹配声明的学习条件。
关于评分标准设计,每条评分点必须代表一个独立的业务结果,要求覆盖至少四个语义上不同的业务决策,明确禁止用不同措辞重复奖励同一个判断。研究团队通过一次修改一个业务结果并验证其他评分点不变的方式来验证评分标准的正确性。
关于校准,仅仅确保基线难度合适是不够的。一道任务可能因为缺少关键信息而很难,也可能因为测试题需要的规则在训练题里根本没有出现而很难,这两种情况需要区分对待。当一组任务校准失败时,应该修改任务设计、调整证据或重新设定训练测试关系,而不是调整评分权重来凑出目标分数区间。
关于评测系统本身,组织实验的AI代理本身的能力也很重要。如果评测代理模型能力不足,它可能错误地分配文件、把技能和错误的测试任务配对,或者在容器故障时处理不当,导致评分结果失真,而这与被测AI的能力毫无关系。因此评测代理的模型版本、推理设置、权限和重试策略都必须在可对比的实验中保持固定。
说到底,这项研究给了我们一个清醒的认识:AI确实能够通过处理真实工作任务来学习和进步,而且这种进步是真实可量化的。少样本监督是目前最可靠的学习方式,能让AI在处理没见过的新任务时准确率提升最多16.44个百分点。更令人鼓舞的是,进化后的AI不仅答得更准,还花的资源更少,说明它真的掌握了更高效的工作方式,而不只是更用力地"蛮干"。
然而,即便是目前表现最好的进化后AI,准确率也停留在67%左右,距离研究团队设定的91.6%理论上限还有相当大的差距。这意味着AI自我进化领域还有大量工作要做,而GDPevo这套考试体系为后续研究提供了一个坚实的起点。
对于普通人而言,这项研究意味着未来的AI助手可能会变得更像一个真正懂业务的老员工——它能从实际工作经历中积累专业知识,在面对公司特有的复杂规则时也能举一反三,而不必每次都从头学起。当然,这个目标还没有完全实现,但GDPevo的出现至少让我们有了一把靠谱的尺子,来衡量离这个目标还有多远。有兴趣深入了解的读者,可以通过arXiv编号2608.03764查阅完整论文。
Q&A
Q1:GDPevo基准和普通AI测试基准有什么不同?
A:GDPevo专门测试AI"边做边学"的能力,它的训练题和测试题之间存在刻意设计的规则关联——训练题里分散隐藏了各种企业业务规则,测试题则把这些规则重新组合,只有真正学透规则的AI才能在测试时举一反三。普通基准往往只是静态打分,不测试AI能否从经验中学习。
Q2:少样本监督、反思式监督、自主监督这三种学习方式哪个最好?
A:总体来说少样本监督效果最好,提升幅度最大,类似于给AI看了标准答案来学习。但跨领域迁移时,反思式监督更稳健,负面影响更小,学到的技能更通用。自主监督效果最弱,但仍优于完全不学习,至少帮助AI了解了工作环境的结构。
Q3:AI自我进化能力的上限是多少?
A:研究团队用"人类操作员配合AI、掌握全部隐藏规则"的理想条件测出了91.6%的上限。目前最好的进化后AI得分约67%,仍有超过24个百分点的差距,说明现有AI的自我进化能力还远未达到理论上限。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.