快科技8月19日消息,SuperCLUE放出DeepSeek V4 Pro正式版中文测评报告,这款8月13日刚发布的旗舰大模型,拿下综合总榜第2的名次,智能体编程板块进步非常明显。
DeepSeek V4 Pro原生支持百万级长文本解析,官方宣传在推理、编程、智能体任务上,已经达到行业第一梯队水平。
![]()
这次SuperCLUE一共拉来13个国产模型同台对比,测评一共设置六大考核项,还特意提高了智能体编程的权重,占比达到25%,很看重模型完成完整工程任务的实力。
对比预览版,它的几项核心分数涨得很可观。智能体编程从47.37分涨到63.16分,一下子提升15.85分。
智能体任务规划上涨6.48分;幻觉控制从79.70分提升到89.73分。推理效能也同步变好,不再只是单纯堆分数,推理耗时得到优化。
![]()
当然迭代也有取舍,精确指令遵循的分数出现小幅下滑,看得出开发团队优先去强化长链路智能体、深度推理这部分能力。
横向对比Qwen3.8 Max,它在幻觉推理表现更好,不过指令遵循、智能体编程还有追赶空间,智能体任务规划依旧存在5分左右的差距。
整套测试全部是纯文本场景,智能体任务规划会受这个条件限制。
简单来说,这次更新最大看点就是编程、智能体能力,更适合写代码、做复杂任务规划的开发者。
但它并不是全维度全部变强,部分能力还有优化空间,普通用户和开发者选型的时候,可以结合自己实际需求去判断。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.