网易首页 > 网易号 > 正文 申请入驻

Github热榜第二:仅靠“自验证”框架让 DeepSeek V4 Flash 反超 Fable 5,成本不到 1/11

0
分享至


作者 | 四月

一个已经训完的大模型,不换参数、不做微调,究竟还能榨出多少性能?

当行业纷纷把目光投向 Test-time Scaling,指望在推理阶段‘大力出奇迹’的当下,一份名为LLM-as-a-Verifier的开源框架在社区引发了现象级讨论,并迅速冲上 GitHub 热榜第二。


当 AI Agent 任务越来越复杂,如何评判大模型输出的对错,一直是个昂贵且棘手的难题。而由 Jacky Kwok 牵头,联合斯坦福大学、加州大学伯克利分校和英伟达研究院学者组成的团队,给出了惊艳的解法。

在极具挑战的 Terminal-Bench 2.1 基准测试上,DeepSeek V4 Flash 仅靠对每个任务采样 5 条候选轨迹,再以自身作为 Verifier 从中挑选最优解(Best-of-5),系统成功率即从 79%飙升到了 88%,一举超越了闭源前沿模型 Claude Fable 5。

更受关注的是调用成本:DeepSeek 自验证单任务成本约 0.11 美元,而 Fable 5 则约 1.3 美元,成本不到后者的十分之一。有网友质疑,11 倍的成本差距可能只来自单 Token 价格差。由于自验证需要多次采样和检查,完成每个任务实际上消耗了多得多的 Token,总价未必便宜。


论文一作 Jacky 回应称,公布的成本已经包含“生成 N 条候选轨迹”与“后续验证”两部分的全部开销。虽然消耗了更多 Token,但得益于开源模型极低的 Token 单价,最终核算下来的“单任务总成本”依然实现了碾压级的优势。

DeepSeek V4 Flash 的自验证实验


早在今年 7 月,研究团队就已发布了论文《LLM-as-a-Verifier: A General-Purpose Verification Framework》,核心突破在于:提出一种不额外训练专门奖励模型(Reward Model)或验证器,就能直接利用现有 LLM 对 Agent 的完整执行轨迹进行细粒度验证和排序的方法。目前该研究已经在 Coding、机器人控制和医疗诊断等多个领域完成验证。(https://arxiv.org/pdf/2607.05391)

这次更新的 v0.2.0 框架,主要新增 DeepSeek V4 Flash 验证支持和 Terminal-Bench 2.1 自验证基准。实验整体架构的巧思之处体现在:LLM-as-a-Verifier 不只用于测试时扩展,验证信号还可以用于进度跟踪和强化学习。过去,我们要对复杂的 AI Agent 进行强化学习微调,最大的阻碍是缺乏高质量的“奖励信号”,而这套框架基于概率加权的“连续验证分数”,恰恰为其提供了极其平滑、高密度的奖励信号(Dense Reward)。

在设计上,在对于每一个具体的终端控制任务,系统首先由 DeepSeek-V4-Flash 生成 5 条mini-swe-agent执行轨迹。随后,模型自身同时承担起“裁判员”的角色,为这些候选轨迹打分,最终由LLM-as-a-Verifier框架完成细粒度排序并挑出最优解。

实验结果呈现出了极其显著的性能跃迁:

阶梯式涨点:在不介入验证时,模型单次生成的原生成功率仅为 78.7%;而在 Best-of-3 设定下(在前 3 条候选轨迹中筛选),系统成功率跃升至 86.5%;当扩大至 Best-of-5 时,成功率直接被推高到了88.0%



  • 逼近上限的 Oracle 指标:更为关键的一项指标是 Oracle(理想选择上限)达到了 96.6%。原论文进一步汇总不同 Agent 配置后的数据显示,理想选择器下的覆盖率最高甚至可达 98.9%。



换句话说,对于绝大多数复杂任务,只要给模型 5 次尝试机会,正确的解题轨迹其实早就已经包含在候选池中了。大模型从来不缺“生成正确答案”的能力,过去真正限制系统表现的,是一双能把正确答案精准挑出来的“眼睛”。

成本也是这组实验受到关注的重要原因。团队测算中,DeepSeek 一侧使用 DeepSeek V4 Flash Max,价格按照当时 OpenRouter 报价计算,生成多条候选轨迹和后续验证的成本都已经包含在内


从“粗糙裁判”到“概率显微镜”

有人提出,既然候选池中早已存在正确轨迹,为什么行业沿用已久的“LLM-as-a-Judge(大模型裁判)”方案在此前总是挑不准?

事实上,传统裁判机制的核心痛点,在于离散评分的颗粒度过粗。传统的评判方式通常要求大模型直接输出一个 1 到 5 分的整数分数。然而在处理长逻辑代码或复杂系统操作时,两条存在细微质量差异的执行轨迹,往往会被模型同时判定为 4 分或 5 分。


原论文实测表明,单次离散评分的平局率高达26.7%。当超过四分之一的候选方案陷入平局时,系统根本无法完成最优筛选。

这暴露了离散评分的瓶颈,而后续实验进一步发现,提高评分粒度、增加重复验证和拆分评价标准,都能持续提升验证准确率。这意味着 Test-time Scaling 不只有“多生成”,验证侧计算能力的持续提升本身也可以成为独立的 Scaling 维度。

LLM-as-a-Verifier的破局点,就在于它不再依赖模型吐出的干瘪文本,而是深入截获模型在输出评价时的“潜意识”——底层对数概率分布(logprob)

核心机制:连续评分

普通 LLM Judge 通常只读取模型最终输出的离散分数,而 LLM-as-a-Verifier 进一步利用不同评分 Token 对应的概率分布,计算一个连续验证分数。

因此即使两条轨迹最终都被判为“4 分”,只要模型对相邻评分档位的概率分布不同,仍然可以继续拉开差距。

验证能力的三维扩展(3D Scaling)

在此基础上,团队还把 Verification Compute 沿三个方向扩展:增加评分粒度、对同一轨迹重复评估、把复杂评价拆成多个 criteria 分别判断。


实验显示,随着三个方向上的验证预算增加,Verification Accuracy 都继续提升。这也是论文把 Verification 定义为一条独立 Scaling 轴的重要依据。

算法与工程降本:PPT 排序与前缀缓存

在落地工程中,伴随候选数量的增加,全量两两比较(Pairwise Comparison)的计算复杂度会呈现可怕的 爆炸。


团队因此提出Probabilistic Pivot Tournament(PPT),避免对所有候选做完整两两比较,用更少的比较完成候选排序;工程侧又通过前缀缓存进一步降低长 Agent 轨迹的重复输入成本。

重新审视 Agent 的算力账本

过去 Test-time Scaling,更多讨论多采样、多搜索,LLM-as-a-Verifier 补上了另一半:候选生成出来以后,验证本身也值得投入计算。对开发者而言,模型选型不再只是看单 Token 价格,而要看单位成功任务的总成本。廉价模型多跑几次,再通过 Verifier 筛选,依然可能比直接调用昂贵旗舰模型更划算。

这对开源模型尤其重要。过去高质量验证往往依赖额外训练 Reward Model、PRM,或者调用更强模型做 Judge;Jacky 团队则证明,现成 LLM 本身就能承担相当一部分细粒度验证工作,甚至可以同时作为生成者和验证者。Verifier 因此有机会进一步进入 Agent Harness,成为运行时基础能力。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
我卖掉深圳的房子回县城,卡里躺着1000万却跟亲戚说我负债了。没两天,借给我钱的3个发小就上门来要钱了

我卖掉深圳的房子回县城,卡里躺着1000万却跟亲戚说我负债了。没两天,借给我钱的3个发小就上门来要钱了

人间颂
2026-08-23 11:40:48
菲副总统萨拉弹劾案出铁证!证人亲口承认:她亲自下令转走1.25亿

菲副总统萨拉弹劾案出铁证!证人亲口承认:她亲自下令转走1.25亿

娱乐圈的笔娱君
2026-08-24 00:30:15
女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

看世界的人
2026-08-07 09:22:50
李乃文紧急声明:王玉雯哭跟我没关系!网友:看出来了就是你

李乃文紧急声明:王玉雯哭跟我没关系!网友:看出来了就是你

韩小娱
2026-08-22 16:30:32
破天荒一幕!美媒抨击特朗普患上老年痴呆,总统和自家海军起冲突

破天荒一幕!美媒抨击特朗普患上老年痴呆,总统和自家海军起冲突

军机Nova
2026-08-24 00:13:28
张智霖演唱会家人现身!儿子长得帅,妈妈好年轻,袁咏仪状态真好

张智霖演唱会家人现身!儿子长得帅,妈妈好年轻,袁咏仪状态真好

舊事別提
2026-08-23 11:19:45
第二个许家印!又一首富栽了!世界500强竟是假的,千亿帝国清零

第二个许家印!又一首富栽了!世界500强竟是假的,千亿帝国清零

蜉蝣说
2026-07-17 09:47:08
油价调整最新通知:8月28日24时,预计国内汽柴油零售价每升上涨0.3元左右

油价调整最新通知:8月28日24时,预计国内汽柴油零售价每升上涨0.3元左右

台州交通广播
2026-08-23 19:00:45
人死后最残酷的真相:断气那一刻,你就不再是谁,只剩一具尸体

人死后最残酷的真相:断气那一刻,你就不再是谁,只剩一具尸体

宝哥精彩赛事
2026-08-22 18:26:09
南京地铁S3号线遇故障停车超10分钟,现场听到异响,临停期间出现短暂停电

南京地铁S3号线遇故障停车超10分钟,现场听到异响,临停期间出现短暂停电

鲁中晨报
2026-08-23 15:54:03
社会隐形吸血阶层浮出水面:不生产、不劳作靠收割底层普通人暴富

社会隐形吸血阶层浮出水面:不生产、不劳作靠收割底层普通人暴富

记录生活日常阿蜴
2026-08-23 04:06:56
中共卧底叛变,向上司坦白身份,没想到上司也是中共卧底

中共卧底叛变,向上司坦白身份,没想到上司也是中共卧底

芊芊子吟
2026-08-23 17:35:12
我妈被姑姑扇了4巴掌,我爸摘下338万手表递给我妈:媳妇,咱们走

我妈被姑姑扇了4巴掌,我爸摘下338万手表递给我妈:媳妇,咱们走

潮河讲堂
2026-01-27 16:11:39
继“野莓”之后,乌克兰无人机首次击中Ozon仓库 ,打击进入新阶段

继“野莓”之后,乌克兰无人机首次击中Ozon仓库 ,打击进入新阶段

山河路口
2026-08-22 13:43:03
谢霆锋估计现在心里五味杂陈,他怎么也想不到,女朋友王菲在那英的演唱会上,比在自己的演唱会开朗大方多了。

谢霆锋估计现在心里五味杂陈,他怎么也想不到,女朋友王菲在那英的演唱会上,比在自己的演唱会开朗大方多了。

叭卦星闻
2026-08-23 12:41:38
“美貌单出,才是死局!”云南留守小女孩因颜值走红,评论区现实又扎心

“美貌单出,才是死局!”云南留守小女孩因颜值走红,评论区现实又扎心

妍妍教育日记
2026-08-20 09:10:18
从油车换到新能源车后我悟了:宁可花多点钱,也要坚持3不买

从油车换到新能源车后我悟了:宁可花多点钱,也要坚持3不买

沙雕小琳琳
2026-08-23 09:46:57
王志文:哭穷和炫耀可以帮你省去90%的麻烦,在亲戚朋友面前,一定要哭穷,在不认识的人一定面前要炫耀,顺序千万不能错

王志文:哭穷和炫耀可以帮你省去90%的麻烦,在亲戚朋友面前,一定要哭穷,在不认识的人一定面前要炫耀,顺序千万不能错

LULU生活家
2026-08-14 20:57:44
释放马尔万·巴尔古提——漫威演员加入呼吁释放巴勒斯坦恐怖分子马尔万·巴尔古提的运动

释放马尔万·巴尔古提——漫威演员加入呼吁释放巴勒斯坦恐怖分子马尔万·巴尔古提的运动

老王说正义
2026-08-23 10:56:42
李在明,真是老狐狸之中的老狐狸,特朗普威胁韩国分摊 100 亿军费,李在明反呛特朗普:我完全同意“韩国的安全应该由韩国自身来负责”

李在明,真是老狐狸之中的老狐狸,特朗普威胁韩国分摊 100 亿军费,李在明反呛特朗普:我完全同意“韩国的安全应该由韩国自身来负责”

扶苏聊历史
2026-08-22 15:38:44
2026-08-24 02:48:49
InfoQ incentive-icons
InfoQ
有内容的技术社区媒体
12841文章数 52040关注度
往期回顾 全部

科技要闻

“英伟达发通知:涨价15%以上”

头条要闻

男子凌晨浏览黄色网站深陷"约炮"骗局 21.8万没了

头条要闻

男子凌晨浏览黄色网站深陷"约炮"骗局 21.8万没了

体育要闻

46岁小罗复出,为什么选了一支意丙球队?

娱乐要闻

王传君的舞台,藏着与乔任梁的过往

财经要闻

加拿大宣布“全额对等报复”美国新关税

汽车要闻

刘苗苗:极狐不押注单一爆款,增长进入体系化阶段

态度原创

数码
艺术
本地
公开课
军事航空

数码要闻

PC玩家雪上加霜!NVIDIA为天价内存续命

艺术要闻

我连新鲜白菜都买不起,土豪却花500万抢着买颗“烂包菜”?这世界终于疯成这样了!

本地新闻

《牛来》的一声“妈妈”,到底多少人被精神污染了

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美国批准向韩出售导弹 此前特朗普称与金正恩关系良好

无障碍浏览 进入关怀版