M3 留下的体验落差还没完全消化,新的 Flash 又来了。可这次,用户面前已经不缺选择。
MiniMax M3.1 Flash 发布了。看到这个消息,我更想问的是:这回,有多少人愿意再认真试一次?
DeepSeek 有 V4.1 Flash,智谱有 GLM-5.3-Flash,千问也有 Qwen3.8-Flash。现在再多一个 Flash,当然可以关注,但“又发了新模型”本身,已经很难成为一个足够强的换用理由。
尤其是对那些试过 M3、觉得没达到预期的人来说。上一回花了时间,结果没有想象中好;这一回又要注册、配置、跑测试。如果最后体验差不多,何必折腾?
我觉得,这才是这次发布值得聊的地方:MiniMax 要争取的,不只是关注,还有用户再试一次的耐心。
M3 的问题,是没有接住一部分人的期待
M3 发布时,MiniMax 把编程能力、百万上下文和原生多模态放在一起宣传。这套组合很容易让人期待:不光会回答问题,还能读懂大项目,把复杂任务做完。M3官方发布说明
但从部分公开测试看,期待和体验之间确实有落差。
Local Model Bench 在6月3日记录的一组本地 Agent 测试中,M3 能完成短任务,却在涉及多个文件、素材生成、校验和最终报告的长流程中出现了收尾失败。一项30篇文章的任务,到900秒超时时留下23份 Markdown,却没有完成校验器和报告。原始测试记录
这只是该测试环境里的结果,不能代表所有工具和任务。但它指出了一个很实际的问题:做出大半,并不等于交付完成。
把模型接进工作流以后,用户要的是最后那个能用的结果。代码写了一堆,测试没跑完;材料生成了,报告没交出来,人还是得回去接手。此时,宣传里的“长上下文”和实际的“长任务可靠性”,就是两回事。
也不能因此说 M3 什么都不行。DataLLM Lab 的另一组九项短代码测试中,它全部通过。两份材料放在一起看,更合理的判断是:M3 在一些任务上有能力,但长流程体验并没有让所有人满意。短代码测试
对于已经失望过的用户,这会影响下一次选择。我认为他们更可能先等可靠的评测,再决定要不要重新投入时间,而不是看见版本号升级就立刻切换。
偏偏这时候,Flash 又扎堆了
如果市场上只有它一个新选择,M3.1 Flash 的吸引力会更容易解释。现在的问题是,用户已经有好几个候选。
DeepSeek 在9月10日发布 V4.1 Flash,官方更新记录已经给出 API 调用型号。GLM-5.3-Flash 有公开模型卡和 API 入口。阿里云8月27日的发布文章则明确区分了开放权重的 Qwen3.8-Flash-Next 和线上服务的 Qwen3.8-Flash。DeepSeek更新记录、GLM官方模型卡、Qwen发布说明
模型
已确认的公开信息
本文没有做什么
DeepSeek V4.1 Flash
9月10日发布,提供API
未做同任务性能对照
GLM-5.3-Flash
官方模型卡提供权重与API信息
未核实对每个用户的实际体验
Qwen3.8-Flash
发布文章列出线上服务,另有Flash-Next权重
未混用两者的实测成绩
这些模型不因为都叫 Flash 就能力相同,我也没有做过四款模型的统一对照。这里真正成立的是:M3.1 Flash 上线时,用户面对的已经不是一个缺少替代品的市场。
修 bug、写小功能、处理材料,如果现有模型已经够用,新模型就得展示一个具体的优势。少返工,明显更快,或者相同任务的成本更低。总得有一项,值得用户挪过去。
如果能力差不多,不换也很合理
“不想折腾”听上去有点懒,放到实际使用里,却是很正常的选择。
换模型往往不止改一个下拉框。API Key、套餐、工具兼容、思考档位,可能都要重新确认。原来的提示词在新模型上是否还好用,多轮任务会不会掉约束,也得自己试。
即便工具已经把切换做得很方便,判断新模型靠不靠谱,依然需要时间。
如果花一个晚上做对照,最后发现它只是这道题好一点、那道题差一点,对日常工作没有明显帮助,那么留在熟悉的模型上,完全说得通。
能力差不多,是继续用旧模型的理由,不是再折腾一遍的理由。
这句话的前提当然是“在你的任务里差不多”,不是给几款模型排一个未经测试的名次。有人看重中文写作,有人需要多模态,有人只想让 Agent 稳定把活收尾。优势得落到这些具体事情上,才有意义。
M3.1 Flash 要补的,是一个可信的换用理由
到9月28日查阅时,MiniMax 官方已经列出 M3.1-Flash-Preview,支持多模态、百万上下文和可调思考深度,当前入口是 Token Plan 和 MiniMax Code。官方模型列表
SDK 文档也列出了调用示例:思考有五档,默认 max,且不能关闭。想比较它的速度,至少要把档位说清楚,不能只凭 Flash 这个名字下结论。官方SDK文档
但对上次没用满意的人,最有说服力的更新,会是那些问题现在解决了:长任务能顺利收尾,约束不再漏掉,同样的活更少需要人接手。
这些进步,本文还没有实测,不能替它保证。
标题里的“没人讨论”也不是字面事实。LINUX DO 已经有人贴演示、等评测。但有讨论,和能让用户重新产生期待,还隔着一段距离。社区讨论
我对这次发布的看法是:M3 的体验落差可能让一部分人选择观望,而 Flash 选择变多,又让观望有了更充分的理由。两件事叠在一起,新版本就不能只靠“我来了”吸引人。
如果能力差不多,用户估计真不想折腾。MiniMax 得拿出那一点“不一样”,而且最好是干活时马上能感受到的不一样。
你现在常用的是哪款 Flash?如果 M3.1 没有明显拉开差距,你还会专门试一遍吗?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.