速评qwen3.8-max-preview:Coding 能力和 Kimi K3 一个水平,超越 GLM 5.2,不如 Fable 5。
依然是跑了葬 AI 基准测试,Fable 5 断半档领先 qwen3.8-max-preview和 Kimi K3,后两者区别很小。尤其是两个模型都还不稳定,都有超低分轮次拉低平均分。但 Kimi K3 相较 qwen3.8-max-preview 更不稳定,高分很高,但低分轮次更多,可能是由于推理资源(aka 卡不够)的问题。
图一是详细排名,但 qwen3.8-max-preview 是预览版,Kimi K3 很不稳定,每天测出来的结果都不一样,只能看个大概意思。下周发稿这两个模型时会重跑测试。
问题在于,qwen3.8-max-previe的非 Coding 能力不行。
应该是没有针对非 Coding 能力做后训练,还没来得及,Kimi K3 肯定是优化过的。
比如图二,同样是根据杨圣照片生成 3D 模型,GPT-5.6-Sol 效果一眼最好,Kimi K3 和 Fable-5 其次,都属于能看出来人样的水平。而 qwen3.8-max-preview生成的就很难称之为人了。最糟糕的是 Seed Evolving(Seed 最新版本)直接生成了一个方块。
我的直观体感是,qwen3.8-max-preview和 Kimi K3 的Coding 能力是一个水平,但 qwen3.8-max-preview没有优化非 Coding 能力。不过考虑到这是预览版,Qwen 3.8 将按日更新,看看正式版能不能提升全面能力。
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.