网易首页 > 网易科技 > IT业界 > 正文

硬刚Gemini 3.0 Pro!DeepSeek V3.2实测性能确实猛,但这三个“硬伤”不得不防

0
分享至

作者 | 小小

出品 | 网易科技

硅谷早晨惊醒,发现追兵已至。当中国对手拿出了旗鼓相当的产品,却打出“完全免费”的底牌时,这场仗该怎么打?

硬刚Gemini 3.0 Pro!DeepSeek V3.2实测性能确实猛,但这三个“硬伤”不得不防

12月1日,DeepSeek带着他们的全新“双子星”—— DeepSeek-V3.2正式版(日常推理的“打工仔”)和DeepSeek-V3.2-Speciale(专攻推理的“顶流学霸”)杀回来了:奥赛金牌拿到手软,推理能力比肩谷歌,直接开启了AI的“免费顶配”时代。

“人们以为DeepSeek只是一次性突破,但我们以更大规模回归。”项目贡献者陈方在社交媒体上的这句“豪言”,无异于向全球AI圈下了一封“硬核战书”。

硬刚Gemini 3.0 Pro!DeepSeek V3.2实测性能确实猛,但这三个“硬伤”不得不防

网络上瞬间“炸锅”,无数用户涌入评论区,甚至有人高呼:“ChatGPT安息吧!”

YouTube知名SEO博主朱利安·戈尔迪(Julian Goldie)在测评后直言,这款刚刚发布的模型,在几乎每一项顶级推理和编程测试中,都对那些收费昂贵、壁垒森严的闭源巨头发起了强有力的挑战。

硬刚Gemini 3.0 Pro!DeepSeek V3.2实测性能确实猛,但这三个“硬伤”不得不防

DeepSeek-V3.2不仅在编程竞赛中荣获金牌,更轻松解决奥赛级数学难题。更疯狂的是:它完全开源,支持直接本地运行,成本甚至仅为GPT-5的1/25。

正如网友所惊呼:“有些人还没意识到这次发布的分量有多重!”它不仅是一项技术突破,更是对“开源比闭源落后8个月”这一说法的当头棒喝。

硬刚Gemini 3.0 Pro!DeepSeek V3.2实测性能确实猛,但这三个“硬伤”不得不防

现在,让我们一起研读“刚刚宣布”的白皮书和技术报告,看看这个V3.2究竟是如何成为“顶级AI时代的免费入场券”的。

有网友评论认为:中国在顶尖模型应用层的“追赶窗口”已经基本关闭,中美AI竞赛已进入“贴身肉搏”的白热化阶段。

你还在支付昂贵的API费用?不好意思,别人已经开着免费的“顶配超跑”上路了。

硬刚Gemini 3.0 Pro!DeepSeek V3.2实测性能确实猛,但这三个“硬伤”不得不防

01性能狂飙:顶级“学霸”Speciale的“奥赛金牌收割机”模式

戈尔迪表示,这次发布的焦点无疑是DeepSeek-V3.2-Speciale。这个拥有6850亿参数的“大聪明”,直接带着一叠金光闪闪的“成绩单”登场,让所有闭源模型都感受到了来自“别人家孩子”的压力。

它在干什么?它在“收割金牌”:

· 2025年国际数学奥林匹克竞赛(IMO):Speciale豪取35/42分,稳拿金牌

· 国际信息学奥林匹克竞赛(IOI):拿下492/600分,再次斩获金牌

· ICPC世界总决赛:一口气解出10/12题,直接锁定总排名第二

有网友看到这串成绩直接“原地起飞”:“IMO、CMO、ICPC金牌?🏅 DeepSeek的Speciale不仅仅是突破极限——它简直是颠覆极限!这种竞技成就足以引起整个领域的关注。绝对震撼!🚀”

硬刚Gemini 3.0 Pro!DeepSeek V3.2实测性能确实猛,但这三个“硬伤”不得不防

在与闭源巨头的正面PK中,Speciale 更是打出了“王牌”,直接把GPT-5和Gemini 3.0 Pro“摁在地上摩擦”。它用事实证明:开源模型也能成为顶尖水平的代名词。

· 在美国数学竞赛 AIME 2025上:Speciale 变体通过率达96.0%高于 GPT-5-High 的94.6% 和 Gemini-3.0-Pro 的95.0%

· 在哈佛-麻省理工 HMMT 数学竞赛上:Speciale 得分 99.2%超越 Gemini 的97.5%

与此同时,标准版 V3.2模型在 AIME 和 HMMT 上分别得分93.1% 和92.5%,虽略低于前沿模型,但在计算资源消耗上显著更少

在编程基准测试中,DeepSeek-V3.2在 SWE-Verified 上成功解决了73.1% 的真实软件错误,与 GPT-5-High 的74.9% 旗鼓相当

在衡量复杂编码工作流的 Terminal Bench 2.0上,其得分为 46.4%显著高于 GPT-5-High 的35.2%。这意味着它在处理实际复杂代码工作流时,思路更清晰、效率更高,简直就是程序员的“顶级外挂”。

有网友评论道,DeepSeek 的新模型非常强大,性能已经能和 GPT-5、Gemini 3.0这些顶级闭源模型正面竞争了。尤其是它在数学竞赛等推理任务上的表现,标志着开源模型达到了新高度。既然免费开源的模型已经这么好,再花钱用闭源 API 就不划算了,这宣告了开源时代的全面到来

硬刚Gemini 3.0 Pro!DeepSeek V3.2实测性能确实猛,但这三个“硬伤”不得不防

硬刚Gemini 3.0 Pro!DeepSeek V3.2实测性能确实猛,但这三个“硬伤”不得不防

硬刚Gemini 3.0 Pro!DeepSeek V3.2实测性能确实猛,但这三个“硬伤”不得不防

技术白皮书“大揭秘”:打破性能魔咒的三大突破

DeepSeek 团队在白皮书中坦诚了一个核心痛点:尽管开源社区在努力,但闭源专有模型(如 Anthropic、OpenAI)的性能提升速度更快,二者之间的性能差距非但没有缩小,反而看似在扩大。

但 V3.2就是来终结这个“魔咒”的。它的成功并非靠简单堆叠算力,而是基于三大革命性的技术突破。戈尔迪对此进行了总结:

1. 更智能的注意力机制

传统大模型在阅读长文档时之所以“慢且贵”,是因为它们必须采用更复杂的注意力机制,时刻关注所有内容,导致成本呈指数级暴增。DeepSeek 的解决方案是稀疏注意力(DSA)配合“闪电索引器”

DSA 不再扫描所有 Token,而是通过“闪电索引器”快速检索并只挑选最重要的部分进行聚焦。这就像是 AI 快速浏览一本厚书,只抓住精华要点,而不是逐字阅读。因此,即使在处理128K 的超长上下文时,推理速度也提升了约3.5倍,内存占用减少70%,同时 Token 消耗量显著降低,极大地提升了成本效益。

2. “砸钱”后训练

大多数 AI 公司在模型主训练(预训练)完成后,只会投入一小部分预算进行后训练(微调)。而 DeepSeek 直接“财大气粗”地将其预训练总预算的10% 以上全部投入到了基于强化学习的后训练中

这种大规模的投入和专门的强化学习技术,极大地提升了模型的稳定性和最终能力。他们不再满足于“能用”,而是追求“专家级性能”

3. 智能体合成训练:拒绝“金鱼记忆”

V3.2的 Speciale 模型是专为智能体(Agent)能力而生的。它的核心优势是“思考链”方法,可以多次调用工具而不必重新开始

这种训练的目的是消除传统 AI 在跨工具调用时“丢失思路”的顽疾。为了实现目标,DeepSeek 创建了一个专门的合成训练流程,旨在改进工具使用能力。这使得 V3.2 原生支持“推理加工具使用”,完美适用于复杂的多步骤工作流。

亲身体验:免费跑“金牌模型”的诱惑与现实

戈尔迪认为,最疯狂的部分在于,你完全可以在本地运行它

DeepSeek V3.2在托管网站 Hugging Face 上已经完整开源,模型权重、聊天模板、本地运行指南一应俱全。对于文档助手构建者、智能体系统开发者和长上下文聊天机器人设计师来说,这简直是天降横福。

极客硬核派可以直接去 Hugging Face 或 GitHub,使用 VLLM、Kaggle、Google Colab 或 Transformers 库,动手折腾代码,本地运行。

尝鲜体验派则可以访问 DeepSeek 官网,直接在网页端体验 V3.2的“深度思考”和“非深度思考”模式。然而,我们也要保持清醒:正如实测所见,目前 V3.2还没完全集成到像 Ollama 或 Open Router 这样方便的第三方平台。

如果你不是“代码狂魔”,必须经历“复杂的编码工作”才能本地部署,那么它的便捷性确实打了折扣。

戈尔迪吐槽道:“老实说,对我来说,如果使用起来不那么方便——比如必须去 Hugging Face,然后折腾代码等等——我可能不会经常使用,因为这会耗费我大量时间。”

但如果它能直接集成在聊天界面里,戈尔迪表示会很有兴趣测试并看看它的表现。

优势与局限:五大爽点与三大局限

当然,再强的模型也有其“成长的烦恼”。

戈尔迪总结了 DeepSeek V3.2的五大优势(爽点):能够处理超大上下文(DSA 机制红利)、推理高效(速度快如闪电),在推理和工具使用方面表现卓越(Agent 能力强大),具备专家级性能(基准测试中击败付费模型),并且完全开源

不过,它也有三大局限:在近期世界知识方面仍有滞后(需要外部检索 RAG 来“补课”),标记效率不够优化,且在极其复杂的推理上仍需打磨。

在戈尔迪看来,V3.2应该被视为“推理和工作流引擎”,而非知识问答机。如果你是文档助手构建者、智能体系统开发者或长上下文聊天机器人设计师,它就是你苦候多时的“神兵利器”!

DeepSeek V3.2的发布,不仅仅是一个新模型,更是一个历史性的转折点。它用实打实的性能数据和慷慨的开源策略,宣告了:开源与闭源之间的性能差距正在被迅速抹平。

开源巨兽已出笼,你的 AI 工作流准备好了吗?

相关推荐
热点推荐
167票定音!联合国变天,新主席对华不一般?中方先提四要求

167票定音!联合国变天,新主席对华不一般?中方先提四要求

安珈使者啊
2025-12-01 19:22:32
甲流再次来袭,可能不发烧!医生提醒:出现4个症状,可能已中招

甲流再次来袭,可能不发烧!医生提醒:出现4个症状,可能已中招

瑛派儿老黄
2025-12-01 19:44:33
张家界荒野求生挑战赛主办方确认“刀疤哥”退赛,决赛还剩10名选手

张家界荒野求生挑战赛主办方确认“刀疤哥”退赛,决赛还剩10名选手

极目新闻
2025-12-02 12:16:25
天价收费 围标合谋 利益输送 劣质工程——揭开维修棚架背后的重重黑幕

天价收费 围标合谋 利益输送 劣质工程——揭开维修棚架背后的重重黑幕

爆角追踪
2025-12-01 13:59:15
独行侠三核84分爆冷掘金!约基奇空砍29+20+13 穆雷伤退成转折

独行侠三核84分爆冷掘金!约基奇空砍29+20+13 穆雷伤退成转折

颜小白的篮球梦
2025-12-02 12:19:31
7省份公安厅主要领导调整

7省份公安厅主要领导调整

上观新闻
2025-12-02 12:07:06
超神!东契奇连场首节20+:超詹皇等队史第二 28次并列历史第四

超神!东契奇连场首节20+:超詹皇等队史第二 28次并列历史第四

醉卧浮生
2025-12-02 11:53:11
中国10年期国债收益率首次低于日本,利率和房价曲线与30年前日本类似

中国10年期国债收益率首次低于日本,利率和房价曲线与30年前日本类似

火星宏观
2025-11-27 01:35:22
3000万辆的跨越:一汽-大众以品质与感恩铸就合资车企新丰碑

3000万辆的跨越:一汽-大众以品质与感恩铸就合资车企新丰碑

车驰神往
2025-12-01 15:55:00
东京飞上海航班紧急返航,乘客称“机上一男子被警察带走”,航司未安排住宿,大批游客滞留机场只能睡长椅

东京飞上海航班紧急返航,乘客称“机上一男子被警察带走”,航司未安排住宿,大批游客滞留机场只能睡长椅

极目新闻
2025-12-02 08:48:22
多国齐聚,唯独日本被拒,中国打破外交惯例,给日本右翼立规矩

多国齐聚,唯独日本被拒,中国打破外交惯例,给日本右翼立规矩

军机Talk
2025-12-02 09:53:47
你闻过最难闻的味道是什么?从此对美女有阴影了!

你闻过最难闻的味道是什么?从此对美女有阴影了!

今日养生之道
2025-12-01 19:33:55
5台电脑采购价接近3个亿?广西一单位采购遭质疑,当地回应

5台电脑采购价接近3个亿?广西一单位采购遭质疑,当地回应

极目新闻
2025-12-02 12:47:31
建国后最大矿难纪实:死亡684人,被列为绝密,38年后才被公开!

建国后最大矿难纪实:死亡684人,被列为绝密,38年后才被公开!

兴趣知识
2025-12-01 18:00:41
47岁吴建豪减重40斤,尖嘴猴腮像换了个人,比实际年龄老20岁

47岁吴建豪减重40斤,尖嘴猴腮像换了个人,比实际年龄老20岁

乐悠悠娱乐
2025-12-02 10:40:58
董璇自爆全年都穿一次性内裤,一条100多块,网友集体破防

董璇自爆全年都穿一次性内裤,一条100多块,网友集体破防

星创文化
2025-12-01 22:54:08
涉上海多所高校!男生女生用暗语进行灰色交易

涉上海多所高校!男生女生用暗语进行灰色交易

深圳晚报
2025-12-02 10:45:26
三笘薰拒道歉!布莱顿假道歉!中国球迷协会怒了:停更 提4大要求

三笘薰拒道歉!布莱顿假道歉!中国球迷协会怒了:停更 提4大要求

风过乡
2025-12-02 11:21:00
冬天身上总痒?李兰娟直言:多数人缺这4种营养,还以为是干燥

冬天身上总痒?李兰娟直言:多数人缺这4种营养,还以为是干燥

荷兰豆爱健康
2025-12-01 13:32:52
约基奇29+20+13掘金爆冷遭独行侠逆转 浓眉复出32+13引3人20+

约基奇29+20+13掘金爆冷遭独行侠逆转 浓眉复出32+13引3人20+

醉卧浮生
2025-12-02 12:21:14
2025-12-02 13:27:00

科技要闻

苹果AI换帅:挖印度裔大神 誓要修好烂摊子

头条要闻

佘智江获利达1.5亿元:曾逼美貌女性卖淫 或供"玩乐"

头条要闻

佘智江获利达1.5亿元:曾逼美貌女性卖淫 或供"玩乐"

体育要闻

从夏天到冬天,中国男篮的手感也凉了?

娱乐要闻

张继科与女友张蕊被拍 被传隐婚生子?

财经要闻

浙江富豪"分家产"!儿女将获赠34亿元股票

汽车要闻

方程豹11月销售37405台 成比亚迪增速最快子品牌

态度原创

家居
艺术
教育
数码
公开课

家居要闻

城市中心 心中的理想居

艺术要闻

潘主兰荣获兰亭奖终身成就,书坛巨匠的光辉再现!

教育要闻

咋回事?有成都户口,小升初还是被统筹了?这5种情况要注意!

数码要闻

一加Ace 6T原神神里绫华定制机专属配件公开

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版
×