专注AIGC技术的专业社区,关注大语言模型(LLM)的发展和应用落地,聚焦LLM及AI技术的市场研究和开发者生态,欢迎关注!
刚刚,DeepSeek悄悄上线DeepSeek V4 Pro正式版,
![]()
马斯克高调推出Grok 4.6。
![]()
两者性能直逼顶级闭源,甚至有超越。
每百万输出Token,Grok 4.6要6美元,GPT-5.6 Sol要30美元,Claude Opus 5要25美元,Fable 5要50美元。而DeepSeek只要6元RMB。
DeepSeek每百万输出是Claude Opus 5的约1/29,Agent多项评测分数压过Opus 4.8。
Grok 4.6在综合智能指数上追平GPT-5.6 Sol,职场知识工作三项评测拿下头名。而每百万输出Token是GPT-5.6 Sol 的1/5。
DeepSeek成绩单
DeepSeek V4 Pro正式版在Agent能力上大幅提升。
![]()
网络安全智能体测试CyberGym拿到83.3分,Fable 5是83.1分,Opus 4.8是78.3分。
自动化任务评测AutomationBench拿到31.8分,Fable 5的29.1分和Opus 4.8的27.2分都被压在身后。
终端操作基准Terminal-Bench 2.1上,DeepSeek拿到87.9分,超过Opus 4.8的85.0分,离Fable 5的88.0分只差0.1分,同场Kimi-K3拿到88.3分,守着这一项的头名。
同样的性能,Fable 5是DeepSeek约57倍。
![]()
带工具的人类最后考试HLE中,DeepSeek拿到60.0分,反超Opus 4.8的57.9分,继续追Fable 5的63.0分。
跨度最大的跳跃在软件工程上。
DeepSWE(软件工程智能体评测)从预览版的12.8分直接升到62.7分,提升近4.9倍,超过Opus 4.8的58.0分。
工具调用评测Toolathlon-Verified拿到74.1分,只略低于Opus 4.8的76.2分和Kimi-K3的76.5分。
从预览版到正式版,分数跳升几乎覆盖所有测试项,半个月时间模型升级幅度非常大。
Grok追上来
马斯克这边的Grok 4.6在AA Intelligence Index(综合智能指数)上拿到61分,与GPT-5.6持平,离Fable 5的62分差1分,比Grok 4.5的56分高出5分,一代模型迈出一大步。
![]()
代码编辑器基准CursorBench上拿到69.9%,超过GPT-5.6的67.2%,离Fable 5的70.5%差0.6个百分点。
前沿代码评测FrontierCode上拿到61.3%,压过GPT-5.6的60.6%,紧追Fable 5的64.9%。
![]()
职场知识工作三项评测,Grok 4.6全部拿下头名。
职业工作评测GDPval-AA v2拿到1753 Elo(等级分),高过Fable 5的1741和GPT-5.6的1728。
简报案例评测AA-Briefcase拿到1577 Elo,压过Fable 5的1574。
专业法律任务Harvey LAB(哈维法律评测)拿到15.8%,Fable 5是11.3%,GPT-5.6只有2.5%。
Databricks工程师Ivan Zhou发帖,团队与SpaceXAI合作,在Dbrx Mosaic AI的OfficeQA Pro V2(办公问答评测)上评估Grok 4.6,配合Databricks的Genie Harness拿到当前最好成绩,模型在文档理解和数据推理任务上第一。
![]()
![]()
马斯克在X发帖,把智能、速度、成本放在一起看,与GPT-5.6 Sol、Claude Opus 5对比,Grok 4.6排第一。
![]()
新模型同天发布,分数互相咬,价格互相压。OpenAI和Anthropic的头部模型岌岌可危了。
还有大招
这还没结束,马斯克表示,Grok 4.7将发布,性能会超过现有所有模型!
![]()
而据内部测试人士透露,DeepSeek Harness,“宇宙最强”Agent也将面世。
![]()
![]()
全球大模型竞争格局风云变幻,鹿死谁手未可知。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.