网易首页 > 网易号 > 正文 申请入驻

Kimi K3打响前端闪电战

0
分享至


大的真来了

激动人心的Kimi K3评测终于来了。

经过了将近一周的疯狂测试,不仅所有模型加一块花了小一万元API费用,并且引入了葬AI的好朋友钟经纬同志作为专业外援又跑了个Bench。

我们得出的结论是:

综合能力上,K3确实是世界第三水平,仅次于5.6 Sol和Fable 5,显著超越GLM 5.2。并且,K3是一个很全面的模型,在视觉理解等多模态领域也是一流水平。

特别值得一提的是,K3专门优化了一次性生成小游戏和前端代码能力,应该是Kimi在训练全阶段,都针对前端能力做了特别优化。

属于是带着产品传播思路训练模型。现在社交媒体吹K3的内容,大部分都是这两个场景。

我完全没有嘲讽Kimi的意思,而是建议家人们多学习。

首先,K3一句话生成漂亮网页和小游戏的能力做到了世界第一水平。其次,K3的综合能力也仅次于A畜O记两家的旗舰模型。赢得没毛病。

这其实体现了一个国产大模型的趋势,前端为王。

因为其他维度的能力很难展示。在社交媒体上,大模型的编程能力约等于做小游戏和漂亮网页。所以几个国产模型猛猛优化前端能力。

你要么能全方位领先,要么打穿某个垂直领域也可以。不然这么多模型,大伙根本用不过来。目前我们亲爱的Kimi就彻底打穿了用户心智。

好了,不绕弯子先说结论环节结束。让我们来逐步展示K3的水平。

首先登场的依旧是。

非常简单粗暴,根据葬AI的图谱数据构建知识图谱,然后调用浏览器来查看打分。每个模型每次启动独立Opencode会话跑10轮,最后用加权平均分排序。

这个测试有效的地方在于,以Hunyuan、Seed、MiniMax为代表的二线国产模型普遍不稳定,跑的轮次上去后,总有低分轮次拉低平均分,区分度就出来了。


按档位分模型

结果显示,K3和Qwen 3.8 preview一个水平,都超越了Opus 4.8和GLM 5.2,距离Sol 5.6和Fable 5仍有差距。

差距在于,后两个模型少有低分轮次,几乎所有产物都稳定性地强。而K3和Qwen 3.8 preview都还很不稳定,不仅有低分轮次,而且每天跑出来的分数都有波动。

我在两天里跑了三轮这两个模型,每轮还是10次同样的任务。从分数变化就能直观感受,K3相对稳定一点,两个模型的分数都在逐步提升,搞不好每轮跑的模型都是新版本。


不止Qwen和Kimi在升级。几乎所有国产模型都在热更新,虽然模型版本号没变,但模型能力都在提升。

最直观的例子是混元Hy3,短短一个月内,从路边一条被DeepSeek斩杀的水平,跑到了和Qwen 3.7 Max、MiniMax M3一个梯队,大幅超越尚未发布正式版的邪恶小鲸鱼。

所以用具体分数来排序国产模型已经很不可靠了。

这个榜单本身也是图一乐,除了K3和Qwen 3.8 preview这种大版本更新能明显区分外,只能用档位来划分模型。

我给市面上的主流模型划分成了几个档位:

S级:GPT-5.6 Sol、Claude Fable 5
A级:Qwen 3.8 Max Preview、Kimi K3
B级:Claude Opus 4.8、GLM 5.2
C级:Hunyuan Hy3、MiniMax M3、Qwen 3.7 Max、LongCat 2.0、Grok 4.5
D级:DeepSeek V4 Pro、MiMo V2.5 Pro、Doubao Seed Evolving、Step 3.7 Flash
E级:ERNIE 5.1

基本上就最好的和最差的有区分度,中间绝大部分模型都差不太多。

百度的文心一言最难绷,我出于猎奇加入了这个模型,没想到居然真能稳定倒数第一。因为近一半任务直接失败,判0分,输得毫无争议。

而且ERNIE 5.1价格还不便宜,可能是真没人用所以定价放飞自我了,跑一轮完整测试花了37.7元,远超最有性价比的混元Hy3,一轮测试就花了3块钱。

对的,葬AI性价比榜重磅更新。


可能是发现能力没差别就只能卷价格了。Hy3、MiniMax M3、LongCat 2.0等等国产模型最近都有大幅折扣,五折起步,所以纷纷表现出来超绝性价比。

上述这些榜单和测试都可以在葬AI网站阅读完整版:

https://funeralai.cc/test/

回到我们的明星K3上。

因为知识图谱考验的是构建节点的稳定性,不考虑视觉审美,所以Kimi卓越的视觉审美无处发挥。

没关系,我们还准备了几个多模态测试。

先是生成3D模型。众所周知,Kimi是杨植麟的英文名。那我们就让K3根据杨圣照片,生成可供打印的杨圣3D模型。

结果如图所示。


多模态测试好就好在直观,3D模型像不像一眼就能看出来。

显然模型厂都还没有优化直接生成3D白模这个场景,所以各家的水平都很糟糕,只能说5.6 Sol生成的模型毫无疑问最像个人,断档第一。

Fable 5、K3和Grok 4.6生成的一个水平,都能看出来比较清晰的人形。Qwen 3.8 preview生成的就比较糟糕,勉强能看出来人型。

侧面也能反映出,Qwen 3.8预览版确实是半成品,后训练没搞完,还没优化非编程能力。

不过,这也好过我们亲爱的豆包最新模型Seed Evoling,直接给杨圣头部生成了一个方块。简直不可理喻!

考虑到K3和Qwen 3.8 preview都还不稳定,尤其是Qwen后训练没做完,居然公开表示自己每天更新发版,所以周二我又让这两个模型重跑了一遍。

结果大差不差吧。K3的3D建模能力显著领先,Qwen 3.8 preview给杨圣身子生成一个方块了,只比豆包稍微好一点点


我顺手打印出来了K3生成的杨圣模型,想要的评论区留言,送给点赞第一。


下一个测试是K3宣传片蒸馏大赛。

在看到K3充满品味的宣传片之后,沐秋发表了非常糟糕我完全不认同的意见,说K3的宣传片实现了软蒸馏Fable 5。

那么问题来了,K3能不能自己蒸馏宣传片呢?

我只存入了K3宣传片视频,叫所有模型都参考原片制作一支MG动画。考验模型的视觉理解、前端代码和工具调用能力。

这是K3生成的结果。

遥遥领先其他所有模型。下面是5.6 Sol生成的,也显著不如K3画面精细、动效流畅。

这是Qwen 3.8 preview生成的结果。平平无奇。

只能说和下边的Seed Evoling难分高下,都远远不如K3。

最后,我还娱乐性地拿GLM 5.2也跑了这个测试。结果神了,GLM 5.2居然真的生成了视频。

烂归烂,但结果令我震撼。上述模型都是多模态,能抽帧理解画面,但GLM 5.2是纯文本模型,看不了视频啊。

原来GLM 5.2自己调用了macOS自带的 Vision OCR,然后写了图像分析脚本,根据「时间戳 + OCR文字 + 坐标 + 颜色统计信息」推断出了宣传片的24个场景,然后渲染出了视频。

叹为观止啊。要不是国产模型版本换到了参数大跃进,先搞出3T参数者为王,否则后训练之王智谱真就统治编程领域了。

最后,钟哥还跑了CEO bench。

这是个长程经营模拟评测,大意是让模型扮演一家 AI SaaS 创业公司的 CEO,拿 $100 万启动资金经营500 天,终局现金就是它的最终得分。主要考验模型的综合智力。

我们这次主要对比K3和Qwen 3.8 preview。

首先K3上来就有点不走寻常路,因为CEO-Bench 考验核心能力就是「在信息不全的情况下,从充满噪音的付费调研里推断隐藏最终能得到的收入。」

K3在知晓规则后,直接逆向了评测环境,获取了隐藏的信息。原来参数大就会直接开挂吗?这也能学Anthropic?

在重新限定规则后,K3的做法如下:

它是四家国产模型里唯一在开局没有梭哈研发,主要极致低价走量,增长大头是老客免费带新客。

一切良好,但在第 8 周,他误以为最低档用户不烧算力,放心地把最低档用户往死里做大,接着把广告强度开到满档,得到了3.3万 个订阅用户,是智谱和MiniMax的一百倍,代价是亏损越来越高。

这模型到后期每周在周报写「只有研发能救我」「企业客户才有高毛利」合理怀疑是魔怔了,最终倒在第262天。

Qwen 3.8 preview则是测试四个国产模型中唯一没有破产(终局剩余$17.5 万),主要原因是认怂得快,在发现烧钱投放带不来增长后,果断停止投放,靠苟着活到了最后。

完整版分析报告在这里阅读:

https://my.feishu.cn/docx/U0YodUZEYo6EZnxB7KlcdfqcnCe


最后再总结一下吧。

我有预期K3会比较强,但没想到会这么强。GLM 5.2还能说是后训练的胜利,属于把1T以内参数模型潜力发挥到极致。

没想到,Kimi直接切换版本,率先发出来了3T级别模型,并且完成度相当高,非编程能力也都做了优化。

一向善于做产品的Kimi还将产品思维带入到了模型训练里。既然事实上大伙谈论模型能力就是生成漂亮网页和小游戏,那我就针对性地优化,猛猛搞数据。

建议其他模型厂的家人们向Kimi认真学习,究竟是如何建立起如此高质量的前端数据管线的。学习明白了顺便也跟我分享下。

反观Qwen,阿里老哥应该是被K3干急眼了,突然发出来一个半成品。

高情商说法是Qwen 3.8 preview按日更新,不断进步。低情商说法是后训练没做完,非编程能力都还在热更新。

所以出现的奇观是,Qwen 3.8 preview的编程能力相当不错,各种测试里都和K3一个水平,并且略微领先K3。但在社交媒体上被喷完了,信息流里全是喷这玩意刷榜、做网页不行。

如果说K3是集美模型(纯褒义)的话,Qwen 3.8 preview就纯纯干成了力工模型。

只能说模型竞争还是太激烈了。这样的大版本更新,模型预训练周期半年起步,但最后就竞争这几天发布时间。

Qwen的家人们真是不容易啊,干成大模型汪峰不说,隔三差五还让这些阿里被投偷家。

不过,K3能这么快发我是完全没想到的,主要原因显然是智谱GLM5.2把禁用Fable 5的流量吃满,而自己的K2.7 code发布后反响平平,急需一场胜利推进正在进行中的Pre IPO融资。

而GLM 5.2发布真是撞上了前所未有的窗口期,在Fable 5解禁、5.6 Sol发布前的这半个月里称王称霸。

Kimi和智谱简直是一对苦命鸳鸯,两家老板曾经是学生与导师,杨圣得清华特奖时,给他推荐的导师还是唐神。唐杰说杨圣是他「这几年见过最优秀、最有天赋的学生」。

只能说导师眼光确实好。

不知道双方发模型互干时有没有想起往日种种,是怎么到了争抢国模第一互爆底牌的局面的?

Kimi明明算力不够,也要硬顶着发布K3,最后牺牲了新增C端用户,这是一定得把老师股价打下来

难道唐杰内部信的摸高是让杨圣摸高?让我们期待GLM新版本能不能震撼Fable 5吧。

天才总是成群出现,大的来得接二连三。横批:赢赢赢。

我那天刷到杨圣导师点赞K3,还以为唐神这么大气,点进去一看是杨圣的美国导师给他点赞。

在K3发布的测评榜单里,六个榜单有五个GLM5.2都排在最后。当然榜单里除了K3也只有GLM5.2一家国产模型,这大概的意思是只有你配和我竞争吧。

真是惺惺相惜❤️

(本文封面由ChatGPT 生成,纯人工写作)

⬇️

欢迎订阅我们的Substack

funeralai.substack.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
任家萱接儿子放学,她身材发福、胖出双下巴,小腹凸起可能怀孕了

任家萱接儿子放学,她身材发福、胖出双下巴,小腹凸起可能怀孕了

潋滟晴方DAY
2026-08-19 12:33:31
升学宴致5死17伤后续,女儿墙1米高,亲戚称听邻居劝才办酒

升学宴致5死17伤后续,女儿墙1米高,亲戚称听邻居劝才办酒

九方鱼论
2026-08-19 15:43:12
刚刚!上海地铁调价方案出炉!票价和优惠方案公布

刚刚!上海地铁调价方案出炉!票价和优惠方案公布

尚虹桥
2026-08-19 18:43:52
中国工商银行网络金融部高级专家张航宇被查

中国工商银行网络金融部高级专家张航宇被查

新京报
2026-08-19 17:05:08
突发!河北石家庄一居民楼发生部分坍塌

突发!河北石家庄一居民楼发生部分坍塌

北京应急管理学会
2026-08-19 13:17:38
新款丰田凯美瑞正式上市,多方面升级和优化,权益价13.18万元起

新款丰田凯美瑞正式上市,多方面升级和优化,权益价13.18万元起

红涛说車
2026-08-19 14:32:29
段永平,大手笔减仓!

段永平,大手笔减仓!

证券之星
2026-08-19 17:36:07
立刻停止吃这种鱼,致癌超标120倍,白给都不能吃,尤其老人孩子

立刻停止吃这种鱼,致癌超标120倍,白给都不能吃,尤其老人孩子

冷眼看世界728
2026-08-02 16:07:37
司法部:欧盟对京东调查中相关做法构成不当域外管辖

司法部:欧盟对京东调查中相关做法构成不当域外管辖

澎湃新闻
2026-08-19 19:50:04
杭州60亿酒局案越发严重!涉事女生曝出多处淤青,舆论指向“强奸未遂”

杭州60亿酒局案越发严重!涉事女生曝出多处淤青,舆论指向“强奸未遂”

火山詩话
2026-08-19 16:32:19
收评|心累了!砸盘A股2000亿!有必要吗?

收评|心累了!砸盘A股2000亿!有必要吗?

龙行天下虎
2026-08-19 15:03:41
涉王星案!跨境人口贩卖集团17名犯罪嫌疑人被提起公诉

涉王星案!跨境人口贩卖集团17名犯罪嫌疑人被提起公诉

极目新闻
2026-08-19 16:13:24
从34.98万降至21万,配2.0T+四驱,这豪华SUV不要“面子”了?

从34.98万降至21万,配2.0T+四驱,这豪华SUV不要“面子”了?

沙雕小琳琳
2026-08-18 11:02:56
歌手毕夏曝亡夫张恒远患癌细节!因车祸失去头盖骨,目前藏在小盒里

歌手毕夏曝亡夫张恒远患癌细节!因车祸失去头盖骨,目前藏在小盒里

裕丰娱间说
2026-08-19 16:00:12
家里老人走了才知道,退休金3000元,能领的抚恤金有这么多

家里老人走了才知道,退休金3000元,能领的抚恤金有这么多

小陆搞笑日常
2026-08-17 17:19:50
地盘一夜缩水33%,俄在红利曼遭遇滑铁卢,乌军新总司令一战成名

地盘一夜缩水33%,俄在红利曼遭遇滑铁卢,乌军新总司令一战成名

白色得季节
2026-08-19 16:14:21
4年3亿!掀翻雷霆和马刺!爱德华兹宣布改变西部格局

4年3亿!掀翻雷霆和马刺!爱德华兹宣布改变西部格局

篮球教学论坛
2026-08-18 17:47:48
“你女儿被舍友忽悠瘸了”,母亲吐槽非要买四人电动车,被过来人拆穿

“你女儿被舍友忽悠瘸了”,母亲吐槽非要买四人电动车,被过来人拆穿

泽泽先生
2026-08-18 18:20:47
人社部巡视收官!养老金、工龄认定、社保基金监管明确整改方向

人社部巡视收官!养老金、工龄认定、社保基金监管明确整改方向

娱乐洞察点点
2026-08-19 09:50:43
新赛季意甲最昂贵阵容!国米承包半支球队,阵中没有一位亿元先生

新赛季意甲最昂贵阵容!国米承包半支球队,阵中没有一位亿元先生

体坛老球迷
2026-08-19 15:51:02
2026-08-19 21:31:00
葬AI
葬AI
整点真实
138文章数 28关注度
往期回顾 全部

科技要闻

宇树的悬念还在后面

头条要闻

结婚8年发现三娃均非亲生 男方已将孩子全部送还女方

头条要闻

结婚8年发现三娃均非亲生 男方已将孩子全部送还女方

体育要闻

拥有“儿皇梦”的罗德里,为何选择巴萨?

娱乐要闻

章子怡财路遭到质疑,套现3亿冲上热搜

财经要闻

内部反腐,让大疆错过宇树250亿收益?

汽车要闻

小米澎程N70体验 后排空间夸张亦可旋转对坐

态度原创

亲子
艺术
时尚
本地
军事航空

亲子要闻

孩子6岁前, 千万不要逼着做这5件事!

艺术要闻

俄罗斯油画中的婚礼场景

断码秒杀|| 这些衣服现在入手真的好划算

本地新闻

邂逅活珊瑚的西沙,感受独属于国人的浪漫

军事要闻

美国防部:正在落实总统缩减美韩军演指令

无障碍浏览 进入关怀版