网易首页 > 网易号 > 正文 申请入驻

DeepSeek开始追求极致的“智能密度”

0
分享至

文|象先志

DeepSeek 给新Flash出了一道题:能不能把自己的Pro替下来?

昨天,V4.1 Flash中间版本开启内测。新的模型结构、原生多模态、更快的速度,都是公告里的卖点。但在配套反馈问卷中,DeepSeek直接问用户:"你觉得这个模型能全面替换线上的 DeepSeek V4 Pro 么"。


好嘛,我打我自己。DeepSeek正在测试,把flash到底从效果上能不能超过flash,能不能交给更便宜、更适合大量调用的型号。

Pro 与 Flash 之间,本来就有实实在在的价格差。目前高峰时段每百万输出 token,Flash 收 9 元,Pro 收 27 元。

但是就在刚才,DeepSeek 又在开放平台宣布,9 月 10 日中午起下调 Flash 系列价格:空闲时段每百万 token 的缓存命中输入降至 0.02 元,未命中输入降至 1 元,输出降至 4 元;高峰价格仍为空闲时段的两倍。三项降幅分别为 60%、约 33% 和约 11%。


新 Flash 还在测试能否接替 Pro,Flash 系列的使用门槛已经先往下降了。

开发者可以为了更好的结果,偶尔付三倍单价。但是真的到日常使用,那些可用可不用的环节,flash的必要性就凸显出来了。

DeepSeek想让新版本同时具备两者的长处:Flash快,Pro强,Flash V4.1又快又强。

一年多前,R1的冲击让人们愿意给 AI 更多时间,看看它究竟能想出什么。如今,DeepSeek要回答的是:已经获得的推理能力,怎样才能被更频繁地使用?

"智能密度"开始重要

R1在2025年年初走红时,吸引力也来自这种能力终于变得容易获得。DeepSeek同时开放模型权重,将R1放进官网、App和 API,普通用户打开"深度思考"就能使用,开发者还可以用它的输出蒸馏自己的模型。⁠

高水平推理不再只是少数实验室能够展示的东西。它进入聊天窗口,也进入了其他公司的产品开发。

2025年5月,DeepSeek更新R1时,曾把"思考更深"当成最重要的进步。

在AIME 2025测试中,旧版R1平均每题使用约1.2万个token,新版增加到2.3万个;准确率从70% 提高至 87.5%。这次更新让 R1 答得更准,平均每题的推理消耗也接近翻倍。⁠

这套办法有它的道理。困难题目没有现成答案,模型需要尝试方法、检查中间步骤,发现错误之后重新计算。只要结果值得,额外的等待就能够被接受。

但在2025 年12月发布的 V3.2 报告里,DeepSeek 对自己提出了另一项要求:提高推理链的"intelligence density",智能密度。原因也很明确,为了达到Gemini 3.0 Pro等模型的输出质量,它通常需要生成更长的推理过程。

输出的等待时间已经变得很重要。差距会体现在速度上,也会体现在每次的费用里。

这个问题到了大小模型的分工中,会更加突出。V4 早期模型卡提到,Flash 在给予更多思考预算后,能够获得接近 Pro 的推理表现,但在知识和最复杂的 Agent 工作流上仍然落后。

小模型每一步计算更便宜,却可能要走更多步,才能得到大模型的结果。开发者看到的单价优势,最后能剩下多少,要看任务究竟怎样完成。

所以,Flash要想替代Pro,需要同时改善能力和效率。更快生成冗长的推理,能减少一部分等待;更早找到有效方法,则可能连后面的计算一起省下。对经常使用 AI 的人来说,后者同样重要。

学界已经开始把用户等待的时间放进优化目标。EMNLP 2025 的一项研究指出,计算量最优的测试时扩展方案,并不一定带来最低延迟;研究者需要重新安排并行计算和推测解码,才能在限定时间内取得更好的结果。⁠

DeepSeek也已经在改造生成速度。团队在7月公开的DSpark论文中报告,在V4-Flash线上用户流量下,相比MTP-1 基线、保持相同吞吐水平时,单用户生成速度提升了60%—85%。团队处理的是推测解码中的验证浪费,让用户更快拿到输出,同时顾及整套服务能够承接的请求量。


图 3|DSpark 官方架构图:先生成候选 token,再筛去低置信度尾部,最后由目标模型验证。来源:DSpark 论文图 1(2026 年 7 月,CC BY 4.0)

这对提供API的DeepSeek很重要。请求的更快结束,只有在没有严重牺牲总体服务能力时,才容易有效。开发者需要等待更短,DeepSeek则需要让同一批计算资源更有效地服务用户。

"能不能解决问题"和"用户愿意是否愿意等待解决问题",开始成为两道不同的考题。

它们也对应两种市场。研究人员可以为一道困难问题投入大量计算,日常使用的助手则必须不断响应新的请求。前一种能力向前推进之后,厂商还得把它做成后一种服务,才有机会获得更大规模的使用。

DeepSeek在报告中提出的智能密度,最终会在这里接受检验:原先需要昂贵模型、长时间计算才能完成的任务,能否逐渐变成普通调用。

Agent要完成工作算成本

这次内测当天,LINUX DO用户"觉浅"恰好有一个停机维护页面要做,于是把新 Flash 接进自己的编程工具。

模型的表现让他惊喜。它读到了项目规范中一条早已弃用、却没有删掉的决策记录要求,还认真列出了文档维护、代码提交和审查安排。页面生成后,他提出风格不要与原项目割裂,模型又找出了仓库已有的插画来修改。

他对模型的执行能力很满意,但觉得贵:做完这个维护页面,花了15.5 元。

这也是Agent和普通聊天不同的地方。用户只交代了一项工作,模型却可能在后台运行很多轮:先读项目规范,再查文件、改代码,拿到工具返回的结果后继续检查。每轮调用都可能产生新的输入和输出费用。模型的单价低,不代表整项工作一定便宜。

要让Agent用起来划算,除了降低模型单价,还得检查这些调用有没有必要。有些步骤需要模型判断,有些只是按已经确定的规则读取、筛选和整理材料。如果后者也要一步步交回模型,就会增加调用和等待,中间结果还会不断占用上下文。

DeepSeek开源的Harness,就能参与安排这套执行流程。Deepseek官网用"Agent = Model + Harness"来解释两者的关系:模型负责判断,Harness提供工具、管理会话和运行环境,让模型的决定变成实际操作。

其中的PTC模式,允许模型一次写出一段程序,把多步工具操作串起来。比如,模型需要从一批文件里找出符合条件的内容,可以让程序批量读取、完成筛选,再把相关结果交回来。模型不必读完每份文件后都重新决定下一步,也不必接收全部原始内容。

这样有机会省下的,是完成任务过程中的反复调用与无用输入。DeepSeek在PTC 的官方设计记录中,也把这两类开销列为了需要解决的问题。对开发者来说,最终要比较的,是同样一项工作能否做好,以及做完之后的总账单。

这里有机会省下模型不必反复参与的过程。对于已经知道怎样处理的一批材料,程序可以执行完整流程,模型再针对留下的信息作判断。


图4|V3.2 的工具调用推理保留机制。同一条用户消息引发的连续工具交互保留已有推理;新用户消息到来后移除此前推理。来源:V3.2 技术报告图

DeepSeek对重复计算的处理,也能往前追溯。V3.2报告曾指出,在连续工具交互中丢弃已有推理,会迫使模型重新分析整个问题。因此,团队调整了上下文管理,让此前的推理能够在这一过程中保留。

从模型怎样思考,到工具怎样执行,效率损失已经不能只在模型参数里寻找。

Harness 还记录提示、工具调用及结果,让开发者能够回看任务,检查重复处理和执行失败发生在哪里。

8月10日的一项官方开发记录显示,DeepSeek修正了极简模式的工具与提示词配置,让它使用与强化学习运行环境一致的持久Bash,以保留连续操作的工作状态。

这种细节解释了模型公司为什么还要做执行框架。模型学会了怎样使用工具,实际运行时也得有合适的工具和环境。DeepSeek把其中一套明确的运行方式开放出来,应用开发者就多了一个可以直接采用、检查和修改的参照。

这些改进逐渐汇到同一项工作中:服务端加速生成,模型减少重复推理,执行框架减少不必要的调用。过去是用户盯着AI 想,现在还得让 AI 持续工作而不把费用和等待放大。

日常模型往上走,旗舰就得解决更难的问题

DeepSeek 并不是唯一一家重新安排高端能力的模型公司。

7月24日,Anthropic发布Opus 5,主打以 Fable 5 一半的价格,提供接近其前沿水平的能力,并把它设为Claude Max 的默认模型。

Anthropic甚至直接用"每项任务的成本"来介绍Fable。在官方CursorBench 3.2测试中,最大思考强度下的Opus 5 接近Fable 5 的最高成绩,任务成本约为一半。Cursor 联合创始人Sualeh Asif 在同一份发布材料中,将其概括为以 Opus 的速度和成本,提供接近Fable 的智能。

这与DeepSeek的方向无限相似:一旦高端能力可以更便宜地提供,原来的价格分层就需要重新校准。

Fable和 Astra的定位,可以为下一代Pro 提供一个参照。Anthropic把Fable放在耗时数小时、跨越多个应用,乃至持续多日的编程任务中;OpenAI则将GPT-6 Astra 定位于最困难的端到端工作,覆盖复杂推理、编程、研究和文档制作。

这类旗舰模型争取的是用户愿意交出更多时间和预算的复杂工作。用户给出目标,模型需要自行拆解任务、调用工具、检查结果,并在遇到问题后继续推进。它的价值,要由最终完成的工作来证明。

高端型号需要承担更完整的责任。用户交给它一个任务,期待拿回能够检查、能够使用的结果。模型要能保持方向、使用工具,在失败后继续推进,而不是每过几步就要求用户接管。

从这里看未来的DeepSeek Pro,一个合理的猜想是:如果 Flash 真能承担现在 Pro 的大量工作,下一代 Pro 就可以把更多计算投入更困难、更长的任务,争取 Astra、Fable 所代表的产品位置。要是需要足够时间思考,得出的结果就要足够优秀。

这也解释了为什么原生多模态和Harness会变得重要。一个需要独立完成工作的模型,迟早要读到图表、看到页面,判断自己做出的界面是否符合要求。只会处理文本、只能给出建议,会限制它能够接手的工作。

早在4月发布V4预览版时,DeepSeek就明确提到针对Claude Code、OpenClaw、OpenCode、CodeBuddy等 Agent产品进行适配,展示的成果中包括生成的 PPT 页面。模型已经在进入具体工具中的代码与文档工作。⁠

现在,新Flash 在更新结构和多模态能力,Harness在调整执行方式。把这些动作放在一起,DeepSeek要提高的效率,已经覆盖从一次推理到一项任务的过程。

对DeepSeek来说,提高效率有两种回报。减少完成任务所需的计算,可以降低成本;在相同等待时间里完成更多有效推理,则有机会解决更难的问题。后者会让"深度思考"继续向前,前者则决定这些进步能走进多少人的日常。

V4.1 Flash目前仍是中间版本,全面替代Pro、推理链变短和下一代Pro的定位,都还需要后续结果验证。本文引用的DSpark 提速属于此前 V4 服务的测试,不能直接算成本次更新的成绩。

不过,下一轮竞争要回答的问题已经变了。Flash要让更多这样的工作变得划算。Pro要找到更多值得等待的工作。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
敬一丹追悼会,哭的最伤心的不是丈夫,不是女儿,而是颤抖的她

敬一丹追悼会,哭的最伤心的不是丈夫,不是女儿,而是颤抖的她

青梅侃史啊
2026-09-18 07:10:50
30万斤堆积如山,树上6万斤无人问津,低价卖不动,农民满心无奈

30万斤堆积如山,树上6万斤无人问津,低价卖不动,农民满心无奈

三农雷哥
2026-09-05 12:16:13
彻底凉凉!以为社保“瞒天过海”能养老,十年旧账全被扒干净

彻底凉凉!以为社保“瞒天过海”能养老,十年旧账全被扒干净

你在偷看谁
2026-08-19 21:00:31
敬一丹葬礼现场曝光!多位"大人物"到场,让人泪目的一幕出现了

敬一丹葬礼现场曝光!多位"大人物"到场,让人泪目的一幕出现了

寒士之言本尊
2026-09-17 19:27:05
特朗普撤回对兰斯·施罗耶出任美移民与海关执法局局长提名

特朗普撤回对兰斯·施罗耶出任美移民与海关执法局局长提名

界面新闻
2026-09-18 07:11:45
女生称同济大学痛经请假需脱裤检查,校方回应:必要时会做相关妇科检查,以判断是否处于经期以及是否存在其他妇科疾病

女生称同济大学痛经请假需脱裤检查,校方回应:必要时会做相关妇科检查,以判断是否处于经期以及是否存在其他妇科疾病

先锋新闻
2026-09-17 22:18:47
斑块最怕的“清洁工”,就在你家厨房!一天吃两口,血管干干净净

斑块最怕的“清洁工”,就在你家厨房!一天吃两口,血管干干净净

华庭讲美食
2026-09-16 15:13:45
可口VS百事,谁才是天下第一?

可口VS百事,谁才是天下第一?

混知
2026-09-17 14:35:58
网上几十年来对西安事变的赞颂从未停歇,我只想说句实话:若无张学良扣押蒋介石,何来西安事变的历史转折?认清核心人物方能读懂历史

网上几十年来对西安事变的赞颂从未停歇,我只想说句实话:若无张学良扣押蒋介石,何来西安事变的历史转折?认清核心人物方能读懂历史

人生录
2026-09-16 00:05:14
2026年上海市高校最新排名,华东理工退居第8,上海师大仅排19

2026年上海市高校最新排名,华东理工退居第8,上海师大仅排19

教育导向分享
2026-09-17 22:47:58
国家公开正式承认国内房地产市场有重要变化,未来走势如何?

国家公开正式承认国内房地产市场有重要变化,未来走势如何?

靓仔情感
2026-09-17 04:22:10
这A级片不上院线,真是可惜了

这A级片不上院线,真是可惜了

独立鱼
2026-09-17 23:06:14
俄媒看懂了,中国076根本不是小航母,是美国从未见过的新舰种!

俄媒看懂了,中国076根本不是小航母,是美国从未见过的新舰种!

壹知眠羊
2026-09-18 07:14:28
脸都不要了!湖南洞口孩子买了50元学平险,结果真得癌了,谁料保险公司翻出国际疾病分类,说编码不对,不符合“恶性肿瘤-重度”条款

脸都不要了!湖南洞口孩子买了50元学平险,结果真得癌了,谁料保险公司翻出国际疾病分类,说编码不对,不符合“恶性肿瘤-重度”条款

火山詩话
2026-09-10 10:40:36
苹果最贵手机还没开售就翻车?高负载发烫、反折闪屏引质疑

苹果最贵手机还没开售就翻车?高负载发烫、反折闪屏引质疑

第一财经资讯
2026-09-17 20:00:32
新股鸿富诚公布中签结果,中签号码仅1.31万个,股民中了注定吃大肉!

新股鸿富诚公布中签结果,中签号码仅1.31万个,股民中了注定吃大肉!

数据挖掘分析
2026-09-18 07:08:51
携程上架太空旅行船票售价510万 销量从681份变2份 客服回应:2份是平台自营

携程上架太空旅行船票售价510万 销量从681份变2份 客服回应:2份是平台自营

快科技
2026-09-16 09:36:23
iPhone 18 Pro Max抢疯了,订单排到10月15日,突然不想买了

iPhone 18 Pro Max抢疯了,订单排到10月15日,突然不想买了

搞机小帝
2026-09-15 16:12:55
份额仅0.1%了,三星手机,为何还不退出中国市场?

份额仅0.1%了,三星手机,为何还不退出中国市场?

互联网.乱侃秀
2026-09-17 14:21:37
彻底反转!陈锦婷根本不怕官司赔钱,真正的软肋早已暴露无遗

彻底反转!陈锦婷根本不怕官司赔钱,真正的软肋早已暴露无遗

社会日日鲜
2026-09-16 13:36:10
2026-09-18 07:56:49
蓝鲸新闻 incentive-icons
蓝鲸新闻
财经信息服务平台
138675文章数 194124关注度
往期回顾 全部

科技要闻

理想i9来了,这价格战连自己人都打

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带裙、脱黑丝袜

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带裙、脱黑丝袜

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

旅游
本地
时尚
手机
公开课

旅游要闻

严打之下,旅游强迫购物乱象为何屡禁不止

本地新闻

不止胖东来!许昌藏着半部三国史

潮流之向,自有回响——浪潮音乐大赏特别企划

手机要闻

苹果iPhone 18 Pro系列今日正式开售,国行9999元起

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版