网易首页 > 网易号 > 正文 申请入驻

DeepSeek公布Prover-V2技术报告,定理证明达到业内最佳

0
分享至

继昨日放出新开源模型 Prover V2 之后,DeepSeek 在今天又公布了它的技术报告。

这份报告长达 34 页,披露了更多该模型的重要技术细节和基准测试表现,让我们有机会进一步了解它的创新之处。

DeepSeek Prover V2 系列模型有两个尺寸:7B 和 671B 参数。

DeepSeek-Prover-V2-671B 在 DeepSeek-V3-Base 基础上进行训练,推理性能更强。

DeepSeek-Prover-V2-7B 则基于 DeepSeek-Prover-V1.5-Base 构建,上下文长度得到了扩展,最高可达 32K token。

其中,DeepSeek-Prover-V2-671B 在神经定理证明(neural theorem proving)领域超越了之前的模型:MiniF2F 测试集在 Pass@32 下达到了 82.4% 的准确率。

两个模型都已经开源,可以在开源社区 Hugging Face 上找到。技术论文则是在 GitHub 上(模型和论文链接在文末)。

据论文介绍,DeepSeek Prover V2 是一个专为 Lean 4 形式定理证明设计的开源大型语言模型。其最大创新点在于,能将非形式化的数学推理能力与严格的形式化证明过程结合在一起,实现了两种思维模式的有效融合。

你可以想象一下,当我们要解决一道数学题时,脑海中往往先有一个大致的思路,然后再一步步填充细节。这种从整体到局部、从思路到步骤的过程,对人类来说很自然,但对AI却是一项艰巨的挑战。

在 AI 发展历程中,GPT 和 Claude 等大语言模型(LLM,Large Language Model)已经展示出令人印象深刻的数学问题求解能力。它们能够通过“思维链”(CoT,Chain-of-Thought)方法,像人类一样逐步思考问题,甚至能解决一些竞赛级别的难题。

然而,在更为严格的数学领域——形式化定理证明方面,AI 的表现却相对逊色。

原因在于两种思维模式的本质差异:自然语言推理是灵活的、启发式的,允许一定程度的模糊性和跳跃性思维;而形式化证明则要求百分百的精确性和严谨性,每一个推理步骤都必须经过严格验证,不允许任何隐含假设和细节省略。

就像两种不同的语言,虽然表达的是同一个数学世界,但规则和要求却大相径庭。

为了解决这一挑战,DeepSeek-Prover-V2 采用了一种创新的“递归定理证明流程”,这一流程的灵感源自人类数学家解决复杂问题的方法——将困难问题分解为一系列更容易解决的子问题。

首先,研究团队利用 DeepSeek-V3 模型担任“分解专家”的角色,构建定理证明系统的基础框架。

当面对一个复杂的数学定理时,DeepSeek-V3 会用自然语言分析和理解问题,提出高层次的证明思路,将整个证明分解为一系列较小的子目标,最后将每个子目标翻译成严格的 Lean 4 形式语言表达,由 have…sorry 语句组成,也就是需要解决的子目标。

这种方法也是人类所用的证明构建方式,即将复杂定理逐步简化为一系列更易管理的引理。

一旦复杂问题被分解为多个子目标,研究团队就会使用更小的 7B 参数模型作为解题专家,逐一攻克这些子目标。这种方法不仅提高了效率,还大幅降低了计算资源的消耗。

DeepSeek 采用递归求解策略系统地解决每个中间证明步骤。他们从 have 语句中提取子目标表达式,用它们替代原始问题中的目标,并将前面的子目标作为前提条件。

这种构建使后续子目标能够利用早期步骤的中间结果,从而促进更局部化的依赖结构,有助于开发更简单的引理。

为了减少大量证明搜索的计算开销,使用专门优化的小型 7B 证明模型处理分解后的引理。成功解决所有分解步骤后,原始定理的完整证明就可以自动推导出来。

在这个过程中,证明模型的训练需要大型形式语言问题集,但从人类编写文本形式化获得的训练信号通常较为稀疏,因为大部分计算尝试都不会产生成功的证明,因此不提供积极的奖励信号。

为了产生更密集的训练信号,DeepSeek 利用子目标扩展用于模型训练的形式语句范围,生成两类子目标定理:一类将前面的子目标作为前提条件,另一类则不包含前提条件。

这两类子目标被整合到专家迭代阶段,建立一个课程(curriculum),逐步引导证明模型系统地解决精心策划的一系列挑战性问题。

随后,研究团队挑选了一些 7B 证明模型无法“端到端(完全)解决”,但“所有子目标均已成功解决”的挑战性问题。通过组合所有子目标的证明,他们构建了原始问题的完整形式证明。这个证明再与 DeepSeek-V3 的自然语言推理过程配对,创建了“冷启动推理数据”。

“这使我们能够收集数百个高质量的合成冷启动数据,作为训练 DeepSeek-Prover-V2 的基础。”论文写道。

这些冷启动数据之所以珍贵,是因为它们同时包含了两种形式的数学推理:直观的自然语言思考链和严格的形式化证明步骤。就像是给 AI 提供了一本内容丰富的“双语教材”,帮助它学习如何在两种表达方式之间自如转换。

有了冷启动数据后,研究团队通过面向推理的强化学习(Reasoning-oriented Reinforcement Learning)进一步优化模型性能。在这个阶段,DeepSeek-Prover-V2 会学习如何更好地连接非形式推理与形式证明构建,特别注重保持证明结构与初始分解思路的一致性。

这个过程类似于学生在掌握基本思路后,通过不断练习和反馈来提升解题能力,逐渐形成自己的解题风格和策略。

在训练阶段,DeepSeek-Prover-V2 采用了两阶段训练策略,建立了两种互补的证明生成模式:

  • 高效非链式思维(non-CoT)模式:快速生成简洁的形式 Lean 证明代码,不包含明确的中间推理步骤。
  • 高精度链式思维(CoT)模式:系统地阐述中间推理步骤,强调透明度和逻辑进展,构建最终形式证明。

训练过程中,研究团队使用“专家迭代”方法不断提升模型能力。每次迭代中,用当前最佳模型(策略)尝试解决之前未能解决的问题,成功的证明被添加到训练数据中,用于改进模型。

这个迭代循环持续进行,使模型能够逐步提高解决难题的能力。

此外,在强化学习阶段,DeepSeek 使用了“群体相对策略优化”的算法,相比传统 PPO 效果更好、效率更高。

性能方面,DeepSeek-Prover-V2 在多个主流基准测试中都取得了不错的成绩。

在评估 AI 形式证明能力的标准测试集 MiniF2F 中,DeepSeek-Prover-V2-671B 创造了新记录。在尝试 32 次(Pass@32)的情况下达到了 82.4% 的准确率,当增加到 8192 次(Pass@8192)时,表现提高到了 88.9%。

即使是参数较少的 DeepSeek-Prover-V2-7B 也超越了以往所有开源定理证明模型。

在评估大学水平数学能力的 ProofNet 和 PutnamBench 测试中,DeepSeek-Prover-V2-671B 同样表现出色。在 ProofNet 测试集上,它以 Pass@1024 指标达到了 37.1% 的解题率。在极具挑战性的 PutnamBench 上成功解决了 658 个问题中的 49 个。

更加令人惊讶的是,研究团队发现较小的 7B 模型在某些特定问题上甚至超越了 671B 的大模型,成功解决了 13 个大模型未能攻克的问题,将总解题数提升至 62 题。

在更全面的 CombiBench 测试中,DeepSeek-Prover-V2 在 77 个问题中解决了 12 个。虽然这一数字看似不高,但考虑到模型主要在数论和代数领域训练,这一表现已经展示了其良好的跨领域泛化能力。

在 15 个来自 AIME 24 和 25 竞赛的数学问题上,DeepSeek-Prover-V2-671B 成功解决了 6 个,而其通用语言模型 DeepSeek-V3 则解决了 8 个。

研究团队认为这一对比结果很有趣,因为它表明形式数学证明与非形式数学推理之间的能力差距正在显著缩小。

最后,DeepSeek 团队计划将创造 DeepSeek-Prover-V2-671B 的经验扩展称一个类似 AlphaProof 的系统,最终目标是挑战国际数学奥林匹克级别的数学问题。

至于传闻中的下一代 V4/R2 模型,说不定也会用上相关的技术进展。

参考资料:

https://github.com/deepseek-ai/DeepSeek-Prover-V2/tree/main

论文链接:

https://github.com/deepseek-ai/DeepSeek-Prover-V2/blob/main/DeepSeek_Prover_V2.pdf

模型链接:

https://huggingface.co/deepseek-ai/DeepSeek-Prover-V2-671B

https://huggingface.co/deepseek-ai/DeepSeek-Prover-V2-7B

排版:刘雅坤

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中央气象台发布暴雨预警:今晚至明晚,江苏、上海、浙江、江西、福建、广东、海南岛等地部分地区有大到暴雨

中央气象台发布暴雨预警:今晚至明晚,江苏、上海、浙江、江西、福建、广东、海南岛等地部分地区有大到暴雨

极目新闻
2026-08-14 18:24:34
16GB+1TB!新机官宣:9月28日,正式发布!

16GB+1TB!新机官宣:9月28日,正式发布!

科技堡垒
2026-08-14 09:36:21
游戏主播家里电信千兆宽带被限速,因“上载内容过多”;维护人员:正申请复速;客服:暂无法恢复

游戏主播家里电信千兆宽带被限速,因“上载内容过多”;维护人员:正申请复速;客服:暂无法恢复

大风新闻
2026-08-14 18:30:31
大跌!今晚,大幅降价!

大跌!今晚,大幅降价!

山西晚报
2026-08-14 11:27:35
8月14日,人社部关于2026年调整退休人员养老金通知公布了吗?

8月14日,人社部关于2026年调整退休人员养老金通知公布了吗?

小彬说事
2026-08-14 11:21:38
WTT大满贯!8强诞生,大藤惨败,王艺迪惊险逆转,张本美和又零封

WTT大满贯!8强诞生,大藤惨败,王艺迪惊险逆转,张本美和又零封

南海浪花
2026-08-14 20:42:09
深圳一酒吧多名女子穿近似海航空姐制服跳舞,酒吧:当天为“空姐主题”,是网购的服装;海南航空:侵犯外观专利,已发律师函

深圳一酒吧多名女子穿近似海航空姐制服跳舞,酒吧:当天为“空姐主题”,是网购的服装;海南航空:侵犯外观专利,已发律师函

芒果都市
2026-08-14 16:05:22
陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

北海史记
2026-08-12 19:57:54
麻烦大了!仅24小时,郭德纲再迎3大噩耗,被立案调查仅"开胃菜"

麻烦大了!仅24小时,郭德纲再迎3大噩耗,被立案调查仅"开胃菜"

社会日日鲜
2026-08-14 07:00:02
又抓住了一个巨贪,金额高达9.7亿,首富夫人郝斌跨境逃亡失败了

又抓住了一个巨贪,金额高达9.7亿,首富夫人郝斌跨境逃亡失败了

李橑在北漂
2026-08-14 17:30:07
王毅外长73岁不退休,仍然为国操劳,未来谁能接替他的工作?

王毅外长73岁不退休,仍然为国操劳,未来谁能接替他的工作?

张嘴说财经
2026-08-14 15:56:32
海风:《纽约时报》这三篇报道给台湾释放了什么信息

海风:《纽约时报》这三篇报道给台湾释放了什么信息

环球网资讯
2026-08-14 19:28:14
河南造出85.5克拉大钻,不到一个月,欧美珠宝协会:开除钻石籍

河南造出85.5克拉大钻,不到一个月,欧美珠宝协会:开除钻石籍

天天热点见闻
2026-08-14 07:04:47
“抱歉,我们不喜欢肥头大耳的”,女孩公开追求体制内男,面相输了

“抱歉,我们不喜欢肥头大耳的”,女孩公开追求体制内男,面相输了

泽泽先生
2026-08-14 09:31:42
“露骨程度令人发指”,结婚8年3个女儿非亲生:女方出轨更多细节被丈夫爆料

“露骨程度令人发指”,结婚8年3个女儿非亲生:女方出轨更多细节被丈夫爆料

汉史趣闻
2026-08-14 14:45:42
著名学前教育学者、华东师范大学教授刘晓东因病逝世

著名学前教育学者、华东师范大学教授刘晓东因病逝世

澎湃新闻
2026-08-14 10:04:26
正手短问题还是大!林诗栋2-3A·勒布伦无缘欧洲大满贯8强!

正手短问题还是大!林诗栋2-3A·勒布伦无缘欧洲大满贯8强!

篮球资讯达人
2026-08-14 21:47:42
税务部门介绍“社保基数夯实”:稳步推进不搞“一刀切”

税务部门介绍“社保基数夯实”:稳步推进不搞“一刀切”

新京报
2026-08-14 19:00:13
伊拉克“中国龙”餐厅合伙人讲述真实“龙餐馆”:最舍得消费的是雇佣军,但有时一场爆炸就带走几个常客

伊拉克“中国龙”餐厅合伙人讲述真实“龙餐馆”:最舍得消费的是雇佣军,但有时一场爆炸就带走几个常客

红星新闻
2026-08-14 19:04:23
海港3-2三镇升中超第8!交手8连胜 10分钟3球逆转 李昂绝平球被吹

海港3-2三镇升中超第8!交手8连胜 10分钟3球逆转 李昂绝平球被吹

我爱英超
2026-08-14 21:35:26
2026-08-14 21:59:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17085文章数 515193关注度
往期回顾 全部

科技要闻

苹果为中国训练自有大模型,阿里提供支持

头条要闻

媒体:《纽约时报》连发三篇报道 戳破台当局虚幻想象

头条要闻

媒体:《纽约时报》连发三篇报道 戳破台当局虚幻想象

体育要闻

离开雷霆后,威少再也没成为威少

娱乐要闻

郭麒麟瘦到全网认不出,为新剧塑形

财经要闻

便利蜂加盟遭立案:“0元加盟”生意被查

汽车要闻

吉克隽逸选车和选歌一样绝!新锐动感SUV 长安启源Q06

态度原创

手机
游戏
房产
家居
健康

手机要闻

性能续航大满贯!荣耀WIN2系列10月亮相:万级电池+2nm芯片

太多年轻人变电脑白痴 老哥变"免费顾问"被问烦了

房产要闻

金茂、招商,海南多个岗位招人!

家居要闻

2026建博会(广州) 公装联探展交流活动

专家解答青少年脊柱侧弯七大问题

无障碍浏览 进入关怀版