DeepSeekV4Pro与Grok4.6同期亮相,引发新一轮大模型竞赛讨论。本文基于公开材料,深入解析两款模型的技术升级、能力边界与产品策略,揭示大模型从对话走向任务执行的关键转折,为产品经理提供决策参考。
![]()
这两天,DeepSeekV4Pro和Grok4.6同时进入讨论中心。有人忙着转发跑分,有人已经开始问哪个模型更强,也有人把它们理解成中美大模型竞争的新一轮正面对决。
我把两家公司的官网、模型文档、更新记录和公开报道重新对了一遍,先发现了一个容易让文章出错的地方。
DeepSeekV4系列在2026年4月24日已经发布预览版,其中包括V4Pro和V4Flash。7月31日,DeepSeek正式更新V4Flash,同时说明V4Pro正式版随后推出。截至本文核对时间,DeepSeek官网尚未把8月11日列为V4Pro的全新首发日期。
Grok4.6的情况更特殊。多家海外财经媒体在8月12日报道了它的发布,称其面向长时间运行的智能体和复杂任务。SpaceXAI官网的新闻页、模型文档和开发者更新记录目前仍以Grok4.5为最新正式条目,Grok4.6的完整模型卡、价格页和测试方法尚未同步。
这意味着,眼下能做的是一份基于公开材料的综合分析。DeepSeekV4Pro有模型卡、技术报告和官方测试数据,可以评估得更具体。Grok4.6需要以媒体报道为线索,再用已正式开放的Grok4.5作为能力与价格基线。任何把二者写成完整亲测,并给出精确胜负的文章,此时都跑在证据前面。
不过,这并不妨碍我们回答一个更值得产品经理关心的问题。为什么两家公司都在这个阶段继续推出更强模型,它们真正争夺的又是什么。
我的判断是,大模型正在从对话产品进入任务执行阶段。模型厂商需要同时解决能力、速度和成本之间的矛盾,还要争夺开发者入口。DeepSeekV4Pro与Grok4.6选择了不同路径,却都在为同一件事服务,让模型承担更长、更复杂、能够产生业务结果的工作。
Part.01DeepSeekV4Pro到底更新了什么
DeepSeekV4Pro是一个混合专家模型。官方模型卡显示,它有1.6万亿总参数,每处理一个Token激活约490亿参数,支持100万Token上下文。它保留了DeepSeekV3使用的混合专家框架与多Token预测方法,又增加了混合注意力、受约束的超连接和新的优化器。
参数听起来很大,产品价值要落到用户能做什么。
100万Token上下文意味着模型可以在一次任务里读取更大的代码仓库、更长的合同集合或更多研究材料。长上下文过去经常遇到两个问题。内容放得越多,显存占用越高;模型虽然读进去了,却未必能准确找到散落在前后位置的关键信息。
DeepSeek给出的方案是混合注意力。它结合两种压缩方式,减少模型处理长序列时需要保留的信息量。按照官方技术说明,在100万Token条件下,V4Pro单Token推理所需计算量约为V3.2的27%,KVCache约为后者的10%。KVCache可以理解为模型阅读长内容时保留的临时记忆。它占用越少,同样的硬件就越有机会服务更多请求。
这项变化直接影响产品。企业过去想让模型分析整个代码库,往往要先切块、检索,再反复拼接上下文。百万上下文不能取消检索,也不能保证模型记住每个细节,但它能让团队减少一部分切分工作,并把更完整的任务状态留在一次会话中。
V4Pro还把推理分成三个档位。NonThink面向日常低风险任务,ThinkHigh用于复杂规划,ThinkMax允许模型投入更多计算完成高难度任务。产品可以根据任务风险选择计算预算。改一句标题无需让模型长时间思考,检查大型代码仓库则可以提高推理档位。
这种设计比单纯追求最高跑分更接近真实软件。用户需要的是不同任务对应不同成本。模型永远以最高强度运行,响应会慢,账单也会迅速增加。
Part.02DeepSeekV4Pro的公开表现怎样
DeepSeek在模型卡中给出了多组官方测试结果。V4ProMax在LiveCodeBench上得到93.5,在SWEBenchVerified上解决80.6%的任务,在TerminalBench2.0上得到67.9。它在GPQADiamond上达到90.1,在百万上下文测试MRCR中达到83.5。
这些数字表明,V4Pro的强项集中在代码、数学、长上下文和工具任务。它已经进入顶级闭源模型所在的能力区间。在更困难的SWEBenchPro中,V4Pro得到55.4,说明面对真实代码仓库中更复杂的修改任务,能力仍有明显上升空间。
知识准确性也存在边界。V4ProMax在SimpleQAVerified上得到57.9,DeepSeek同一张对比表中的Gemini3.1Pro为75.6。模型会写复杂代码,不等于它能稳定回答所有事实问题。用它做报告、咨询或行业研究,联网检索和来源核对仍然必要。
官方跑分还需要谨慎阅读。不同公司会使用不同提示词、推理预算和智能体框架。同一个模型换一套工具或增加重试次数,成绩可能明显变化。DeepSeek已公布测试设置,这提高了材料的可读性,但第三方复测仍是判断稳定性的必要一步。
如果从产品角度给V4Pro下一个阶段性评价,我会把它概括为四点。
![]()
这里最容易被忽略的是最后一项。DeepSeekV4Pro的参数规模和长上下文很醒目,它依然是文本模型。通用助手正在向语音、图像和屏幕操作发展,V4Pro在这部分需要依靠外部模型或应用层组合。
Part.03Grok4.6现在能确认什么
截至本文完成时,Grok4.6的官方材料还不完整。媒体报道将它描述为面向长期运行智能体和复杂任务的升级,并称其能力较Grok4.5有所提高。由于SpaceXAI尚未公开完整模型卡,这些信息应当保留来源归属,不能直接当成已经复核的产品参数。
能够确认的基线来自7月发布的Grok4.5。SpaceXAI将它定位为编程、智能体任务与知识工作模型,支持文本和图片输入,拥有50万Token上下文。官方给出的API价格为每百万输入Token2美元、输出Token6美元,输出速度约为每秒80Token。
Grok4.5的重点不只在模型本身。它已进入GrokBuild、Cursor和SpaceXAI开发者平台,还能与Word、PowerPoint和Excel等办公工具结合。模型生成答案之后,产品继续让它改代码、做表格或制作演示文稿。
SpaceXAI官方介绍显示,Grok4.5的强化学习训练覆盖大量多步骤软件工程任务,智能体可以运行较长时间。公司同时强调Token效率。以其公布的SWEBenchPro测试为例,Grok4.5平均输出Token数少于部分对手。这个指标对开发者很重要,模型完成同一任务所走的步骤越少,响应时间和调用费用就越容易控制。
如果媒体对Grok4.6的描述最终被官方材料确认,它的升级重点大概率会沿着这条路线继续。模型需要在较长时间里保持目标,调用工具后能根据结果修正计划,并减少无效步骤。这里的“大概率”是一项推断,最终仍要等待模型卡、API入口和可复现评测。
Part.04两个模型该怎样比较
在现有材料下,给两者排出一个总分没有意义。它们的开放状态不同,能够验证的数据量也不同。更合理的办法是看产品路线。
![]()
DeepSeek的优势在开放、长上下文和部署选择。开发团队可以下载模型权重,研究它的架构,也可以通过API接入。企业对数据和部署有更高控制要求时,这条路线更有吸引力。
Grok的优势来自分发和工具环境。它能进入X的实时信息场景,又通过GrokBuild、Cursor和办公软件接近开发者的工作。模型能力只要达到前沿区间,产品入口就可以放大使用频率。
两家公司也有各自的压力。DeepSeekV4Pro规模很大,开放权重不等于普通企业能够低成本私有部署。企业还要准备硬件、推理框架和运维团队。Grok的闭源路线降低了接入难度,却让客户更依赖供应商的价格、额度和安全政策。Grok过去在内容安全与回答稳定性上出现过争议,新版本仍需要观察这些问题有没有改善。
Part.05这场测评暂时不能得出什么
现阶段最容易出现的误判,是把不同公司公布的跑分直接放在一张排行榜上。DeepSeek公布的LiveCodeBench和SWEBenchVerified结果来自它的测试设置,SpaceXAI对Grok4.5的编程评测也使用了自己的工具、推理预算和运行环境。模型名称相同,只要工具权限、重试次数或时间上限改变,结果就可能不同。
评估长上下文时,一百万Token也只是容量指标。真实体验还取决于信息召回、指令遵循和输出稳定性。模型可以读入一整套项目文档,却可能遗漏中间的一项限制条件。用户最后需要手动核对多少内容,会直接影响这项能力的价值。
价格也不能只比每百万Token的标价。一个便宜模型若需要多次重试,单次任务总成本依然可能很高。一个单价较高的模型若能减少人工确认和错误修复,整体费用反而可能更低。产品经理应把模型费用、工具调用、服务器时间和人工复核放在同一项任务中计算。
因此,本文只给出阶段性结论。DeepSeekV4Pro的技术信息更完整,可以确认它对长上下文、代码和推理成本做了系统更新。Grok4.6的产品方向已经出现,具体能力和边界需等官方材料与独立测试确认。读者可以先把它看作一项待验证的新选项,不必急着替换已经稳定运行的模型。
Part.06为什么偏偏在这个阶段发布
讨论发布时间,不能只看公司想抢热搜。模型行业正在发生几项可以观察到的变化,它们共同推动新版本加速出现。
对话能力已经很难单独形成差异
两年前,能自然对话、写文案和总结资料就足以让用户惊讶。现在,ChatGPT、Claude、Gemini、豆包、千问、Kimi和腾讯元宝都能覆盖这些基础任务。普通用户很难仅凭一次聊天判断模型之间的差距。
竞争因此进入更复杂的任务。模型要读取完整项目,使用搜索和代码工具,执行多轮操作,最后交付可以继续使用的文件。DeepSeek把百万上下文与智能体测试写进V4的核心叙事,SpaceXAI把Grok放进编程工具和办公软件,两者都在回应同一变化。
推理成本开始约束产品增长
智能体比聊天更贵。一次普通问答可能只调用模型一轮,一个编程智能体会读文件、修改代码、运行测试,再根据报错继续修改。任务持续时间越长,Token、工具和服务器消耗越多。
产品团队已经不能只问模型够不够聪明,还要计算一次成功任务花多少钱。DeepSeek用混合专家架构和压缩注意力降低长上下文成本,Grok4.5则强调速度与Token效率。两条技术路线最终都要反映在一项经营指标上,每完成一次用户任务需要支付多少推理费用。
这也是模型频繁推出Pro、Flash、High、Max等档位的原因。企业可以把简单任务交给便宜模型,困难任务再切到高推理档位。路由设计逐渐成为AI产品的一部分。
开发者入口正在快速集中
模型公司需要更多开发者在自己的API上构建产品。开发者一旦完成接入、评测和数据迁移,更换模型会产生工程成本。谁能先进入代码工具、办公软件和企业系统,谁就更容易留下持续调用量。
DeepSeek同时兼容OpenAI与Anthropic的接口形式,降低迁移难度。SpaceXAI让Grok进入Cursor、GrokBuild和云平台。发布新模型可以吸引开发者重新测试,也能推动原有客户升级默认模型。
中美公司面对的资源条件不同
DeepSeek需要在算力限制和国内部署需求下证明,高水平模型能够用更高效的架构运行。开放权重还能扩大研究和产业使用范围。V4Pro的价值因此不仅来自跑分,还来自百万上下文、稀疏激活与更低缓存占用能否在真实部署中成立。
SpaceXAI拥有大规模GPU集群,又有X、Grok和开发工具作为分发入口。它需要证明投入的大量算力能转化成高频任务与持续收入。Grok4.6若强化长时间智能体能力,就能进一步连接编程、办公和企业自动化场景。
Part.07它们与上一代模型有什么不同
DeepSeek的变化比较清楚。V3.2已经支持思考模式和智能体能力,V4把上下文扩展到100万Token,并通过新的注意力结构控制成本。Pro与Flash形成两档模型,前者承担知识和复杂任务,后者覆盖高频调用。推理模式也从一个开关变成多档预算。
这使DeepSeek的产品形态更像一组可调度的计算资源。团队可以先用Flash处理分类、改写和简单工具调用,遇到仓库级代码或复杂研究任务再切换Pro。模型选择开始由任务价值和失败风险决定。
Grok4.5相比早期Grok,已经从强调实时信息与表达风格,转向软件工程和任务执行。它拥有更长上下文、图片输入、工具调用和可调推理强度。若Grok4.6最终确认强化长期智能体,它与上一代的差距应当体现在连续工作的稳定性,而非聊天时偶尔给出更漂亮的回答。
判断这种升级,可以看四个结果。任务中途偏离目标的比例有没有下降,调用工具失败后能否恢复,完成任务所需Token是否减少,用户介入次数有没有降低。这些指标比一张总榜更接近真实产品体验。
Part.08产品经理应该怎样测这两个模型
目前最不建议的测法,是让两个模型写一首诗、回答一道脑筋急转弯,再凭语气决定胜负。这样的测试重复性很差,也无法对应产品需求。
一套可执行的评测可以从真实任务开始。比如让模型阅读一个中型代码仓库,定位一项缺陷并提交修改;或者提供若干份公开报告,要求它形成带来源的结论。每类任务至少准备成功案例和容易失败的边界案例,并固定提示词、工具权限与时间上限。
产品团队可以记录下面这些指标。
![]()
DeepSeekV4Pro还应单独测试百万上下文的有效利用。把同一组关键信息放在文档前部、中部和末尾,观察模型能否稳定找回。随后增加无关材料,查看答案是否受到干扰。能够输入100万Token只说明容量,能够准确使用这些信息才说明产品价值。
Grok4.6在官方开放后,应重点测试长时间任务。让智能体连续运行一到数小时,记录它是否重复调用工具、是否忘记初始目标,以及失败以后会不会扩大错误。SpaceXAI如果公布更高的智能体跑分,这些测试能验证提升是否进入普通开发者的使用环境。
Part.09谁更适合什么产品
需要开放权重、中文任务、长文档分析和可控部署的团队,可以优先评估DeepSeekV4Pro。它尤其适合代码平台、知识管理和研究工具。团队要接受一个现实,超大模型的私有部署费用并不低,很多公司最终仍会选择API或经过压缩的小版本。
已经使用Cursor、X数据或SpaceXAI工具的团队,可以关注Grok4.6的正式开放。它的潜在优势集中在编程智能体、实时信息和工具执行。如果产品涉及高风险内容、企业数据或公开发布,还要增加安全测试,不能只看开发效率。
普通用户无需急着在两个模型之间二选一。DeepSeek的网页与应用版本是否切换到V4Pro,要以官方更新为准。Grok4.6是否进入免费版、SuperGrok或API,也要等待正式方案。模型发布和用户真正获得能力之间,经常隔着灰度开放、额度限制与产品适配。
Part.10这轮发布真正改变了什么
DeepSeekV4Pro最值得关注的地方,是它尝试让百万上下文、前沿代码能力和开放权重同时成立。Grok4.6若按媒体报道强化长期智能体,则代表SpaceXAI继续把模型推向能够持续工作的软件角色。
两条路线最后会在同一个用户任务上相遇。用户给出目标,模型读取大量上下文,调用外部工具,经过多轮执行后交付结果。模型公司要让这套过程足够稳定,也要把成本压到用户愿意持续支付的范围。
未来三到六个月,我会观察三件具体的事。DeepSeekV4Pro正式版何时开放以及应用端是否切换,Grok4.6的官方模型卡与API何时出现,第三方长任务评测能否复现两家公司宣称的提升。如果这些指标成立,新一轮竞争会继续推动AI从辅助回答进入任务交付。
对产品经理来说,眼下最值得做的动作很简单。选一个团队每周都会遇到的复杂任务,保存当前模型的成功率、耗时和成本。新模型正式开放以后,用同一套数据重新测试。版本名称可以制造关注,稳定多完成一个真实任务,才值得改默认模型。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.