研究员|邱慧
一夜之间,大模型圈堪比过年。
DeepSeek-V4-Pro正式版API发布。不过,DeepSeek官方推文中还没发布相关信息,只是官网API定价页面,“DeepSeek-v4-pro”对应模型版本更新为DeepSeek-V4-Pro-0813。
![]()
一张网传的跑分截图显示,部分性能基准测试上,V4-Pro成绩接近Claude Fable 5,超过Opus-S4.8,agent能力大幅增强。
赶巧的是,马斯克的SpaceXAI也迅速推出了Grok 4.6,也提升了agent能力。从它披露的多项智能体编程等基准测试来看,Grok 4.6 high综合性能追上甚至超过了Claude Fable 5 Max。
分别看参数。
公开信息显示,DeepSeek V4 Pro是一款混合专家(MOE)模型,总参数量达到1.6万亿,上下文窗口为100万token,最大可以输出38.4万token。
![]()
Agent能力是这次值得关注的重点。它支持1M上下文长度,最大输出长度达384K Token,同时支持非思考模式和思考模式,思考模式默认开启。其API里开放了普通、高推理以及最高推理三种模式,接口支持OpenAI和Anthropic两种格式,也支持工具调用、结构化JSON输出等能力,基本覆盖当前主流的Agent开发需求。
虽然此前DeepSeek称,近期会有一次价格上调,但DeepSeek V4 Pro目前还没调整变化,缓存命中输入约0.025元/每百万Token,缓存未命中输入3元/每百万Token,输出6元/每百万Token。性价比不用多说。
这里需要提一下的是,8月11日,“DeepSeek Harness(工具框架)”微信公众号此前完成注册,账号认证主体为“北京深度求索人工智能基础技术研究有限公司”(即深度求索北京分公司)。这是DeepSeek首次为Harness业务线单独设立官方发布阵地,不过暂时未看到相关新内容。
Grok 4.6也支持调节推理强度,并针对编程、智能体任务和知识工作进行了优化。
WebDev测试结果中,Grok 4.6 (High)排第七,1618分,紧随GPT-5.6 Sol (xHigh)、Claude Fable 5之后。官方称,Grok 4.6经过Web开发、计算机辅助设计等环境的智能强化学习任务训练。
![]()
它的价格没有DeepSeek V4 Pro那么有吸引力了。其定价为每百万输入token2美元,每百万输出token6美元。
X上一位博主,用同样的素材和同样的Prompt,测试两者在PPT上的制作效果后发现,两款模型给出的成品审美排版相差不大,但Grok4.6在信息密度、耗时上更胜一筹。
不过,DeepSeek V4 Pro与Grok 4.6的共同点,比差异更值得关注。
两家公司的新模型重点都涉及编程、工具调用和长周期任务。这将考验模型的“动手能力”,比如记住长期目标、调用外部工具、自我验证后,发现修复错误等能力。
当然,对于一款要实现“数字员工”的模型,跑分成绩用处没那么大。价格、实际性能、效率才是最终比拼出胜负的维度。从目前来看,DeepSeek V4 Pro似乎还在延续开放模型也能以低成本进入前沿能力区间的性价比之路,Grok 4.6就是更贵但能力更强的高价路线。
谁更胜一筹,需要在一定周期内,对两者“长时间不掉线”的任务执行能力进行综合比拼。毕竟,大模型下一阶段的赢家,可能是能够以可控成本,把任务真正做完的那个。
编辑|符永康
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.