网易首页 > 网易号 > 正文 申请入驻

DeepSeek需要重走来时路

0
分享至

文|超聚焦

DeepSeek融资了,能让大家敞开了烧Token吗?

4月18日,据上海证券报消息,DeepSeek正式启动了成立以来的首次外部融资,目标估值不低于100亿美元,计划筹集至少3亿美元资金。上海证券报记者求证称,有接近人士表示"很有可能",还有不少投资人称:"圈里信息已经‘炸了’。"

截至目前,深度求索公司方面尚未就此次融资消息作出官方回应。路透社表示无法独立核实此消息,但在The Information发布报道后,Reuters、Yahoo Finance、Investing等主流财经媒体相继跟进转载。

在资本圈的狂欢之外,回归到大模型落地的现实里,其实DeepSeek要面临的问题不少,大家对其的期许也有不同。

相比R1模型发布时被捧上天,新一代旗舰模型发布前的DS显然承担着外界更大的期许和压力;而比起跑分、SOTA,在Agent时代里,大家显然更关注的是,DeepSeek当初在训练端打出的"成本通缩",能否重现于如今依然高昂的推理端?

01市场不需要能力更强的R1

DeepSeek的新模型,已经"跳票"很久了。

1月中旬,The Information率先爆料称,DeepSeek计划在2026年2月正式发布下一代模型,并声称其编程实力已赶超Claude、GPT系列等顶尖闭源模型。然而整个2月,官方始终保持静默。

到了2月底,随着官方GitHub代码库中出现"MODEL1"等标识,加上金融时报等媒体和券商研报的发声,市场又传出了新模型将在3月6日当周发布的消息,结果依然是"只闻楼梯响"。

3月中旬,市场传言又有相关流言传出,甚至一度引发了A股算力板块的上涨,针对该传闻,DeepSeek官方企业咨询账号在用户群中回应:"辟谣:R2发布为假消息"。

到了4月中旬,大家苦等不来新模型,但DS的前核心研究员却选择了加入其它大厂。

据晚点报道, DeepSeek研究员郭达雅已经加入字节跳动负责大模型研发的组织Seed,成为agent负责人之一。而此前其离职是因为当时DeepSeek内部Agent的优先级不高,但2026年Agent的火热,也反衬出了DeepSeek在当下这个节点上的某种尴尬:

一边是自己曾经"轻视"的赛道如今成了全行业的主战场,甚至要被对手用自己的人才攻城略地;另一边,却是自己死磕并被外界寄予厚望的底层新模型,迟迟交不出答卷。

大模型圈在过去这一年里经历了翻天覆地的变化,也许是时候放下对DeepSeek那层"无所不能"的技术滤镜了。

毕竟在DeepSeek没有发布旗舰模型的这一年多空窗期里,整个大模型行业比拼的早已不是通用的基座能力。

首先,是原生多模态对纯文本大模型的降维打击。

当Gemini带着Nano Banana 2等模型在图像生成与编辑上大杀四方,当Seedance 2.0在视频生成领域狂飙时,单一文本模型的护城河正在被迅速瓦解。无论是行业竞争还是用户需求,早已跨过了纯文本跑分的阶段,迈向了图、文、视、音全面融合的深水区,成为了头部大模型的标配。

另一边,Coding市场也迎来了彻底爆发。

作为最能直接转化为生产力的高价值垂直场景,AI Coding的商业化空间在过去一年迎来了真正的狂飙。以Claude为代表的模型在这个细分赛道上展现出了惊人的统治力,甚至借力将ARR超过了OpenAI;而Cursor最新一轮融资后的估值也超过了500亿美元。

同时,2026年的Agent繁荣也带来了Token消耗的狂欢。

从OpenClaw到Hermas,都在将大模型的调用频次推向指数级增长。智谱、MiniMax、Kimi等厂商都凭借着海量的API调用狂卖Token,在推理端闷声发大财,甚至还推动了阿里、智谱和MiniMax转向闭源。

DeepSeek如果想要复刻R1发布时的"全网沸腾",它面临的早已不是单点突破的考卷,而是必须要在多模态、代码生成、Agent生态上全面多线出击。

但如今的每一条细分赛道上,都有了"最高的山峰和最长的河流",多模态有谷歌和字节的重兵把守,代码战场是Claude绝对的天下,而在Agent与Token消耗的生态里,更是挤满了红了眼的其他多模型巨头。

如果期望DeepSeek能掏出一个全知全能、在各个维度全面碾压所有顶尖大厂的"六边形战士",既不符合技术演进的常识,也违背了当下AI产业的客观规律。

比起继续沉溺于"拳打OpenAI、脚踢Claude"的技术造神叙事,对于眼下正在艰难算账的整个AI应用层而言,大家真正迫切需要的,其实是一个远比"跑分SOTA"更性感、也更具想象力的东西。

02"价格屠夫"仍是DeepSeek的归宿

当前所有AI使用者最需要的,也是DeepSeek最可能为市场带来的,是一个叫"Token通缩"的故事。

一年前R1横空出世时,它给整个全球AI圈带来的最大"暴击",其实不单单是某几项评测指标超越了GPT-4,而是R1真的太便宜了。

在全行业都笃信"大力出奇迹",觉得只有像Altman、马斯克那样堆满几万张老黄的顶级GPU才能训练出旗舰模型,但DeepSeek仅用了约558万美元的训练算例成本,就撞开了顶尖基座模型的大门,相比之下,GPT-4训练成本高达数亿美元。

如此低廉的训练成本在当时引起了AI算力市场的"恐慌"。

去年1月27日,DeepSeek发布其新AI模型后,美股市场出现了剧烈波动。其中,芯片巨头英伟达股价暴跌16.97%,市值在单个交易日内蒸发了约5926.58亿美元(约合人民币4.3万亿元),创下美股史上最大单日市值损失纪录。


除了英伟达外,其他美国科技巨头也未能幸免。博通股价下跌17.4%,超威半导体公司(AMD)股价下跌6%,微软股价下跌2.14%,谷歌母公司Alphabet股价下跌超过4%。

彼时,DeepSeek用一套极致优化的算法和工程架构向全行业证明:智能的获取成本是可以被打骨折的,并在一年前创下了"训练端通缩奇迹"。

市场普遍担忧AI硬件基础设施的泡沫是不是马上就要破了?但一年多后的今天,大家发现根本不用担心大厂还需要买多少卡,而是自己的钱包还能不能撑得起逐级而上的Token消耗。

据中信证券,Agent带来的巨大Token消耗需求驱动了"老旧款"AI芯片H100租赁价格从2025年10月的约1.70美元/小时/GPU飙升至2026年3月的2.35美元/小时/GPU,涨幅近40%。

在云端,3月到4月间,国内头部云厂商接连调价,打破了行业长期低价竞争惯性。阿里云4月18日起AI算力产品最高涨幅34%,高性能存储涨幅30%;百度智能云AI算力产品上调5%-30%;腾讯云5月9日起AI算力等产品上调5%。全球范围内,亚马逊AWS已于1月对机器学习实例上调价格约15%,谷歌云也进行小幅调整。


为了降低Token消耗,巨头企业也出现了组织架构上的变阵。

3月,阿里宣布成立Alibaba Token Hub(ATH)事业群,CEO吴泳铭亲自挂帅,核心目标就是围绕"创造Token、输送Token、应用Token"来统筹AI业务。换句话来说,就是阿里看到了未来Token巨大的Token消耗,现在要从集团层面上来统筹调配Token了。

到了用户端的体感就更加明显,曾经那场免费送Token额度的"价格战"早已鸣金收兵。

现在一个看似简单的用户指令,后台往往伴随着十几次的循环反思、工具调用以及几万Token的上下文反复重载。而每个Token的消耗,都是在实打实地烧钱。

巧的是看起来过去一年里,DeepSeek也没有停下来Token降本的步伐。

今年元旦假期,DeepSeek提出了一种名为mHC的新架构。该研究旨在解决传统超连接在大规模模型训练中的不稳定性问题,同时保持其显著的性能增益,让算力有限的中小AI企业,也能尝试开发更复杂的大模型。

不久后,DeepSeek开源了名为Engram的模块,并同时发布了与北京大学联合撰写的论文,阐述了一种新的大模型稀疏化方向:条件存储(Conditional Memory)。

而这两篇论文都体现了DeepSeek一直以来的方向:打破算力成本硬约束,通过架构、方法论创新,走出更具性价比的道路。

既然DeepSeek当初能凭一己之力,在训练端把竞争对手们上亿美金的训练成本打到骨折价,打出让英伟达一夜暴跌的通缩效应;那么一年后的梁文峰,又能否在Token消耗逐渐成为天量的现在,在推理端再当一次"价格屠夫",把全行业的Token单价打个骨折呢?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
北京两区已现大暴雨,夜间雨势将逐渐增强

北京两区已现大暴雨,夜间雨势将逐渐增强

新京报
2026-08-11 19:35:15
苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

川渝视觉
2026-04-17 22:13:14
51秒售罄!知名歌手演唱会抢疯了,网友:根本抢不到

51秒售罄!知名歌手演唱会抢疯了,网友:根本抢不到

小椰的奶奶
2026-08-10 11:13:50
难以置信!遵义千里送娃到广州投奔亲戚,结果孩子流落小区没饭吃,评论区炸锅

难以置信!遵义千里送娃到广州投奔亲戚,结果孩子流落小区没饭吃,评论区炸锅

火山詩话
2026-08-11 06:47:16
太怕伊朗暗杀,“特朗普登上空军一号后,转头躲进餐饮车换机返程”

太怕伊朗暗杀,“特朗普登上空军一号后,转头躲进餐饮车换机返程”

观察者网
2026-08-11 21:45:04
16GB+1TB!小米新机官宣:8月11日,正式发布上市!

16GB+1TB!小米新机官宣:8月11日,正式发布上市!

科技堡垒
2026-08-11 10:56:45
曝张婉婷怀三胎!肚大如箩面相变凶,宋宁峰带俩娃、发福油腻邋遢

曝张婉婷怀三胎!肚大如箩面相变凶,宋宁峰带俩娃、发福油腻邋遢

悦君兮君不知
2026-08-11 22:31:07
手机在桌缝里录了40分钟,贾冰这顿饭被“兄弟”卖了个好价钱

手机在桌缝里录了40分钟,贾冰这顿饭被“兄弟”卖了个好价钱

社会日日鲜
2026-08-11 13:19:42
“想一巴掌呼死他!”小男孩在海底捞因为蛋糕被分大哭,妈妈也是够爱了!

“想一巴掌呼死他!”小男孩在海底捞因为蛋糕被分大哭,妈妈也是够爱了!

林林先生
2026-08-11 12:00:03
目不识丁、脑袋空空?易烊千玺获奖后的发言,给流量明星上了一课

目不识丁、脑袋空空?易烊千玺获奖后的发言,给流量明星上了一课

可乐谈情感
2026-08-11 06:46:00
广东,要下雨了!还有8级大风

广东,要下雨了!还有8级大风

城事特搜
2026-08-11 23:27:26
难怪涡扇15全球第1,美曾发现中国在太空造超级金属,六代机已用

难怪涡扇15全球第1,美曾发现中国在太空造超级金属,六代机已用

话史官1
2026-08-10 18:14:39
这次真的怪詹姆斯!湖人缺席揭幕战,这是19-20赛季以来首次缺席

这次真的怪詹姆斯!湖人缺席揭幕战,这是19-20赛季以来首次缺席

爱体育
2026-08-11 23:55:14
再次暴露弱点,赵心童争黑球失利6-5负张安达,中国公开赛一轮游

再次暴露弱点,赵心童争黑球失利6-5负张安达,中国公开赛一轮游

真理是我亲戚
2026-08-12 00:46:45
越媒:越南出门不用带钱包,像中国一样扫码支付,发展无法想象

越媒:越南出门不用带钱包,像中国一样扫码支付,发展无法想象

趣味萌宠的日常
2026-08-12 00:23:25
路径诡异!台风白海豚上演回马枪,江浙沪再迎狂风暴雨

路径诡异!台风白海豚上演回马枪,江浙沪再迎狂风暴雨

汽车造物
2026-08-11 23:47:41
停战是幌子?伊朗采购36架歼10、沙特紧急花60亿抢货,老美却慌了

停战是幌子?伊朗采购36架歼10、沙特紧急花60亿抢货,老美却慌了

疯狂小菠萝
2026-08-11 15:29:52
无视中国网友!波兰名将拒道歉 继续辱华:中国气味像米饭配鸡肉

无视中国网友!波兰名将拒道歉 继续辱华:中国气味像米饭配鸡肉

念洲
2026-08-11 06:50:26
8月,可能真的要见证历史了,第三次化债浪潮刚好被我们赶上了

8月,可能真的要见证历史了,第三次化债浪潮刚好被我们赶上了

流苏晚晴
2026-08-10 15:36:01
威胁爱国少年的恶势力已落网,为什么国内会有如此多“精日分子”

威胁爱国少年的恶势力已落网,为什么国内会有如此多“精日分子”

浯江孤舟
2026-08-10 10:29:20
2026-08-12 03:12:49
蓝鲸新闻 incentive-icons
蓝鲸新闻
财经信息服务平台
136041文章数 194064关注度
往期回顾 全部

财经要闻

AI泡沫的剧本,是2008年的次贷危机?

头条要闻

网红"雅典娜"失踪3年 好友:她被李姓女网友诱骗至境外

头条要闻

网红"雅典娜"失踪3年 好友:她被李姓女网友诱骗至境外

体育要闻

NBA老顽童,抽着大麻喝着小酒告别了

娱乐要闻

“雅典娜”确认被害 细节令人发指!

科技要闻

AI大战变天:扎克伯格突然回头

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

时尚
健康
教育
数码
房产

时速60公里,“慢”车去南非

心血管专家破解猝死八大谣言

教育要闻

低分照样上本科 孩子高考不到四百分,一定要了解湖北专升本

数码要闻

苹果Apple Arcade下月新增两款益智游戏

房产要闻

突发,崖州湾又有大动作!

无障碍浏览 进入关怀版