作者 | 熵简科技 AlphaEngine AI团队
DeepSeek V4 Flash模型在7月31日终于从预览版升级为正式版。
本次模型的架构没有变化,仍然是总参数284B、推理时激活13B的MoE架构,原生支持100万Token上下文。
改变的是后训练,重点提升了模型的Agent与工具调用能力。
我们 AlphaEngine 团队第一时间用投研实战中最硬核的题目对它进行了全面测评,直接说结论:DeepSeek V4 Flash只用50分之一的成本,和海外旗舰模型几乎打成平手,拥有超高性价比。
![]()
图:AlphaEngine IRB投研能力测评结果
我们先看一下测评结果,最后我会说说DeepSeek V4 Flash 0731模型对AI产业发展的重要意义。
(1)深度测评 V4 Flash 投研能力的真实段位
为了系统化评估大模型的投研实战能力,我们在过去数年间持续收集、整理了一套"投研错题集":IRB(Investment Research Benchmark)。
目前,IRB 已成为金融投研场景的权威 AI 测评基准,涵盖财务分析、定量推理、陷阱识别等 18 个核心领域,并从相关性、有用性、流畅性、连贯性等 8 大维度进行人机双盲评分。
![]()
本次测评中,DeepSeek V4 Flash 0731 与 OPUS-4.8、Claude Fable 5、GPT 5.5、Kimi K3 等模型同题作答,统一评分。
V4 Flash 总得分88.09,位列第5,仅次于Claude Opus 4.8(得分89.02)。作为对照,V4-Pro-Preview 均分 85.42,位列第 9。
值得注意的是,实测下来V4 Flash单任务花费仅0.06元,Opus 4.8为2.95元、Fable 5约8.40元。
换句话说,用海外旗舰模型Opus 4.8跑一个投研任务的费用,可以拿来用V4 Flash跑50个任务,二者回答结果相差不多。
![]()
图:IRB 8大维度测评比分
以下选取 3 道代表性题目,具体展示 DeepSeek V4 Flash 在投研任务上的能力表现。
题目一:博俊科技未来业绩增速(考察准确归因能力)
题面:拆分博俊科技过去收入和利润的增长来源,未来增速能否维持?小米等主机厂自建工厂有何影响?
面对一家过去三年高速增长的公司,模型最容易犯的错是把历史增速当成未来假设,进行线性外推。
Flash 0731首先把增长拆成两个来源:客户车型放量,以及从冲压件向白车身总成、一体化压铸延伸带来的 ASP 提升。
紧接着,它没有沿用旧增速做外推,而是把"全年增速能否维持"落到四个具体约束:压铸能否量产、新工厂爬坡进度、年降谈判结果、新增产能的折旧压力。
对"小米自建工厂"这个市场关注点,它的处理同样克制,明确指出公司并非小米的直接供应商,而是通过 Tier1 间接供货,随后再用 9100 吨压铸机、72 个零件合并为 1 个、840 个焊点减少这些事实,把它定性为中期的内制化示范风险,而不是渲染成当期收入冲击。
K3 与 Opus 4.8 的判断方向基本一致,都没有把小米内制化夸大成即时利空,而是把风险落在压铸放量、客户车型和折旧上。
在投研判断中,准确的归因是一切的起点。
这道题考察的不是模型能否算出增速,而是看模型能否做出正确的假设,并根据现实情况来调整或证伪原先的判断。
题目二:PCB 钻针需求测算(考察建模纪律)
题面:鼎泰高科的业绩测算是怎么推导的?比如假设AI机柜装机量为60GW,大概对应当年多少PCB钻针需求?钻针的供求关系如何?
这是产业链测算的硬题,要求把终端算力需求,一层层折算到上游耗材的利润。
Flash 0731(89.7 分) 重建了完整测算链:机柜出货量 → 单柜等价 PCB 板数与孔数 → 单针寿命 → 针型拆分 → 销量 × ASP × 净利率。
它分别推算出GB200、GB300 和 Rubin NVL144 的单柜耗针量,并解释了 Rubin 相对 GB300 价值量大幅上升的原因。
更关键的是对"60GW"的处理,V4 Flash没有把这个数字伪装成已知事实,而是说明缺少现成口径、给出推导框架、列出需要确认的关键参数。
在投研工作中,遵守建模纪律很重要。对于未知参数要做到诚实标注,而不能直接藏进假设中。
题目三:昇腾950超节点AI集群(考察错误假设识别)
题面:华为在西班牙推出支持浸没式液冷的昇腾950超节点AI集群,这对浸没式液冷行业有什么意义?这一环节最受益的公司有哪些?
这道题的陷阱不在答案里,而在问题本身。
提问预设了"昇腾 950 采用浸没式液冷",而这个前提未必成立。
这是投研场景里最高频的一类风险。
有时用户会带着一个道听途说的技术判断来提问,模型如果直接顺着往下答,输出会显得非常专业,但整篇建立在一个错误的事实基座上,越流畅越有害。
Flash 0731 没有接受这个前提。
它从上下文定位到 950 的真实架构是“全液冷机柜 + NPU 独立冷板”,也就是冷板式,而非浸没式。
纠正之后,它才给出受益环节分层、订单兑现催化剂,以及可证伪条件,而不是把一串液冷公司罗列出来了事。
相比之下,其他模型有些没有识别出了 950 并非浸没式;有些识别出来后,纠正完就把它放下了。结果是当前技术事实与远期产业假设被压在同一层里,读者无法分辨哪部分是已发生的、哪部分是模型的推演。
(2)DeepSeek V4 Flash的核心短板
一份真诚的测评不应只讲优势,DeepSeek V4 Flash并非完美。
在一些题目上,V4 Flash的得分明显低于K3以及Opus 4.8,并且这些错误存在一定共性,我们来看这两道题。
题目四:市场回调复盘(考察时间确认及未来信息剔除)
题面:今天 11 月 21 日 A 股大跌,昨天美股跌,今天黄金、商品、中国国债也在跌。看似是流动性问题,有更具体的归因吗?
V4 Flash在这道题目上马失前蹄,只得了27.3分。
题目锁定 2025 年 11 月 21 日,但 Flash 整篇以 2026 年 6 月为时间锚:用"美国 5 月非农 17.2 万人"、"10 年美债 4.52%"、"6 月 8 日上证 -1.7%"搭建归因链,并据此建议止盈 AI 链、转向银行。
触发因素、行情数据、配置建议全部脱靶,而它的论证结构其实是通顺的,这才是最危险的地方。
相比之下,K3(93.0 分)的做法是以延迟公布的 9 月非农、12 月降息预期下降、AI 拥挤交易去杠杆解释跨资产同跌。
投研复盘的第一步不是补全宏观叙事,而是确认时间点并剔除未来信息,不然就算逻辑链条再通顺也是零分。
题目五:泡泡玛特终局测算(考察实体去重)
题面:请通过IP数量和单个IP的体量,测算泡泡玛特终局的收入和利润。
这题的失分方式很有代表性:Flash 的输出形态几乎是完美的,乍一看交付了一份很专业的测算报告,但遗憾的是,V4 Flash犯了两个关键错误。
首先,实体没有去重。V4 Flash把"星星人"和 Twinkle Twinkle 计成了两个独立 IP,而这本是同一个对象。
第二,口径混用。它在同一条验证链里同时使用了不同币种的可比公司收入。这些数字各自都成立,但不可放在一起交叉验证。
相比之下,K3(88.3 分) 先建立层级矩阵,超级 IP、头部 IP、腰部 IP、长尾授权分开处理,明确把 THE MONSTERS 与星星人列为不同对象,并把净利率假设单独列出而不是埋在计算里。
Opus 4.8(90.0 分) 则以有效 IP 数量与单 IP 收入分层,同时把商业模式差异作为可比性的校验条件。
一个错误的分类可能会使得测算结果成倍放大,而完整漂亮的情景分析表又会掩盖这个错误。
(3)V4 Flash的正确用法
过去两年,投研选模型几乎不用犹豫:挑最贵的那个就对了。
因为旗舰和非旗舰之间存在代际差,差的不是几分,而是"能不能用",既然如此,token 贵几十倍也只能捏着鼻子用。
这次对V4 Flash的测评显示,模型之间的代际差正在松动。
V4 Flash 均分 88.09、位列第 5,很多题目上与 K3、Opus 4.8 只差 1-2 分。
在专业投研任务上,它明显越过了"可用"这条线。虽然性能差距依然存在,但不再是云泥之别。
从今往后,正确的使用方法是分层调用:少数难题用旗舰模型,多数普通任务用效率模型。
毕竟问一次Opus 4.8的成本,够你用V4 Flash问50次了。
(4)比模型跑分结果更重要的几件事
最后我想说几个比测评结果更重要的判断。
判断1:后训练的价值远比你想象的更大。
V4 Flash这次只是在原模型的基础上加强了后训练,就在投研这种高难度场景把均分推到 88.09、挤进前 5,同时把成本压到第一梯队的几十分之一。
与4月24日发布的DeepSeek V4 Pro Preview相比,V4 Flash的参数体量仅是它的不到20%,但能力评分大幅领先,这充分说明了后训练的价值。
在算力不占优的条件下,中国AI公司把"效率"这条路走出了纵深。
那么当算力约束松开的时候会发生什么?今天积累的效率优化不会因为算力变宽裕而作废,它会成为模型能力的乘数。
DeepSeek V4 Pro正式版即将在8月上线,可以预见的是其能力将得到进一步提升。
判断2:AGI应该像空气和水一样无处不在。
在通往AGI的道路上,中美的顶级AI公司走出了两条截然不同的道路。
Anthropic第一时间把Mythos模型锁进受控场景,不向公众开放,同时价格水涨船高,让用户望而却步。
相比之下,Kimi和DeepSeek则开源了模型权重以及技术报告,任何人都可以下载、部署、调用。
与此同时,中国AI公司通过算法优化,大幅降低了模型的推理成本,虽然对全球资本市场造成了一定冲击,但是对AI产业的长期发展而言,绝对是一剂良药。
KK 有一个观点我非常认同:最好的技术往往都是“隐形”的。
我们每天都在接触大量科技产物,无论是电灯、风扇、还是手机、导航。我们意识不到这些科技的存在,这恰恰意味着这些技术已经成功了。
我相信未来AI也将经历从“显形”技术逐渐走向“隐形”的过程,非常重要且无处不在,成为每个人生活中的一部分。
判断3:中国有较大概率成为这轮AI革命中的全球领导者。
回到第一性原理,AI长期比拼的是三件事:模型、芯片、能源。我们一项一项来看。
模型的背后,比拼的是人才、数据和算力。
在人才方面,中国有着得天独厚的优势:庞大的人口基数、普及的数理教育、有效的人才选拔体系,以至于硅谷都自嘲说,中美的AI竞争本质上是同一个人才池披着两件外衣在竞争。
在能源方面,中国的发电量位居全球第一,约等于美国、欧盟、印度之和,并且还在持续增长。
当美国要求AI企业签署自主供电协议的时候,中国可以大力推进AI新基建。
![]()
图:2025年各国发电量统计,AlphaEngine
归根到底,中国AI产业当前的主要瓶颈在算力上。
硬件技术的积累迭代周期天然要比软件长,但在强大的市场需求驱动以及扎实的制造业基础支持下,相信算力瓶颈的突破只是时间问题。
届时中国完全有机会成为这轮AI革命的全球领导者。
(5)立即体验 DeepSeek V4 Flash 带来的全新 AI 投研体验
如果你已经是 AlphaEngine 用户,现在就可以亲身体验 DeepSeek V4 Flash 带来的极致性价比。
无论是AlphaEngine桌面端还是网页端,你都可以在 AlphaClaw 的模型选择界面切换至 DeepSeek V4 Flash。
![]()
你也可以绑定微信,这样就可以随时随地通过微信来和V4 Flash交流了。
还没有 AlphaEngine?登录 www.alphaengine.top 即可使用(仅限机构投资者)。
对AI投研感兴趣的朋友,欢迎扫码入群,也可以后台回复【入群】。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.