网易首页 > 网易号 > 正文 申请入驻

实测Kimi K3:国产模型见过能打的,没见过这么敢要价的

0
分享至

1679分。

今天凌晨看到Arena AI更新Frontend Code Arena榜单时,我第一反应是有点意外。刚刚发布的Kimi K3,压过了Claude Fable 5的1631分和GPT-5.6 Sol的1618分,排在全球第一。


Code Arena的机制是公开盲测:同一道前端任务交给两个匿名模型,用户实际体验两个结果后投票,投完才知道自己选的是谁。百万级用户参与,品牌影响被削弱。换句话说,至少在强调视觉呈现和交互实现的前端编程场景里,K3已经坐到了目前最靠前的位置。

不止这一张榜,Artificial Analysis Intelligence Index,一个覆盖推理、编程、知识等能力的综合评测,K3拿到57分,排第三,仅次于Fable 5和GPT-5.6 Sol,领先Opus 4.8和GPT-5.5。在七个前端细分领域中,K3拿下六个第一,仅在游戏领域落后Fable 5。


一个刚发布的开源模型,轻松超过多款闭源旗舰,说实话,第一反应是不太敢信。

所以我们花了一天的时间,给K3上了七个维度的测试。不测官方案例,全部原创prompt。其中3D浮岛测试直接复用了十天前测GPT-5.6四模型的同一道题,当场对决。

先说结论:K3很强,但强得有点偏科。它是目前我们测过的前端编码能力最强的模型,没有之一。同时它也是我们见过的定价最大胆的国产开源模型。

全球最大开源模型,2.8万亿怎么炼成的?

先讲清楚这是什么。

K3是月之暗面7月16日发布的旗舰模型,2.8万亿参数,MoE架构,896个专家中每次激活16个,原生视觉理解,100万token上下文窗口。完整权重计划7月27日前开源,届时将是全球最大的开源权重模型。


架构上有两个核心创新,一个是Kimi Delta Attention,混合线性注意力机制,让模型处理超长序列时不会被计算量拖死。另一个是Attention Residuals,有选择地跨深度检索信息,不是简单在各层均匀累积。一个管技术长度,一个管技术深度,合起来撑住了万亿级以上的参数规模。


配合Stable LatentMoE框架和训练方法的优化,官方博客称整体扩展效率相比K2提升了约2.5倍。

能有多强?除了前面说的两张榜,我们再列几个硬核数字:

FrontierSWE拿到81.2分,Opus4.8是66.7,SWE Marathon拿到42.0分,当前所有模型最高。Program Bench77.8分,略超Fable 5的76.8。DeepSWE 67.5分,接近Fable 5的70.0和GPT-5.6 Sol的73.0。在官方GPU内核优化竞技场里,max思考强度下K3的表现接近Fable 5,明显领先Opus 4.8和GPT-5.6 Sol。


更离谱的是,K3从零写出了一套GPU编译器。这个叫MiniTriton的项目,基于MLIR构建了tile级中间表示层,实现了完整优化pass到PTX代码生成的流水线。在支持的Roofline基准测试中,性能达到甚至超越Triton和torch.compile。这不是生成几个孤立的内核函数,是搭起了一套真正可用的编译器栈。


月之暗面官方的态度倒是很坦诚,博客里直接写了:「虽然Kimi K3的整体表现仍落后于最强的闭源模型Claude Fable 5和GPT-5.6 Sol,但它在我们的整套评测中展现出前沿水平的能力,并稳定超过了其他所有模型。」

这种坦诚在国产大模型的发布公告里,属实少见。但谦虚归谦虚,K3端上桌的能力,分量一点不轻。

不过跑分是一回事,真正用起来是另一回事,我们决定自己测。

七个维度实测,K3到底行不行?

我们给K3准备了七项测试:从零生成互动应用、3D浮岛作品集、需求矛盾判断、竞态条件Bug调试、长程定价分析、极简禅意美学设计、台球物理推理。每一项的prompt都是原创设计,不和社区demo撞车。

赛博朋克地下诊所:一次过

第一项测试,要求K3从零搭建一个赛博朋克地下诊所互动叙事页面。2049年的非法AI义体医生,霓虹灯管、雨夜窗景、全息投影UI。三位患者各有隐藏故事线,诊断消耗义体零件库存,至少三种结局。八个硬性要求,涵盖视觉设计、状态管理、分支叙事、动效和自测。

K3一次就过了。


生成结果令人惊喜,暗绿和紫色的霓虹配色非常到位,雨滴动效和全息界面扫描动画执行流畅。三位患者的外观描述、症状和隐藏故事线清楚分明,诊断选项确实导向了不同结局。义体零件库存系统运作正常,零件耗尽确实影响了可选诊断方案。

更让人意外的是可玩性,这本质上是一个文字向策略游戏,在看诊过程中你需要根据有限信息做判断,选对药、选对方案。我们反复测试了所有分支,三个结局全部可达。K3还主动加了氛围音效的文字标注,prompt里只要求标注音效位置,它把音效描述写得很具体。


这个案例其实透露了K3在前端生成上的两个核心优势,一是对复杂状态管理的掌控力,库存、分支、多结局这三层状态叠加在一起,没有出现逻辑混乱。二是审美确实在线,暗绿和紫色的霓虹配比没有做成廉价赛博朋克风。和社区刷屏的Minecraft克隆不同,叙事和交互场景更考验模型对UI设计整体感的把握,不止是把视觉效果堆上去。

3D浮岛vsGPT-5.6:正面交锋

这是本次测试的核心对决,十天前我们测GPT-5.6四模型时,用了同一个prompt:

React+Three.js搭建3D浮岛创意作品集网站。对标jordan-breton.com风格,一座漂浮在空中的奇幻岛屿,上面有自然元素和作品展示。四个章节滚动驱动相机运动,从远景俯瞰到中景环绕到近景特写到拉远告别。岛上有展示物件,hover发光放大,click相机推进特写。Bloom后处理、体积云、萤火虫粒子、动态天空。

回看一下GPT-5.6四模型的成绩:Sol功能完整度最高,但点击物件时把背景虚化了;GPT-5.5转场最流畅但审美保持了GPT前端能力的一贯低水平;Luna完成度最低,标题都会重叠,没有虚化没有转场;Terra成品挺草率的,也是GPT一贯的风格。

现在看K3的表现。

首轮生成后npm install && npm run dev,白屏。不过第二轮修复后成功启动。实际画面出来后,我们只能说一句话:这五个模型里,K3是做得最好的一个。


Hero远景俯瞰,岛屿主体、瀑布、云层、远处的浮岛,全部到位。向下滚动,相机平滑环绕90度,小屋和工作台进入视野。继续滚,相机推进到展示区,作品卡片staggered animation出现。悬停到展示物件上,发光加放大,干净利落。滚动到底部,相机拉远,星空渐显,四个章节的滚动相机过渡全部实现。


Bloom光晕、体积云、萤火虫粒子、动态天空从白天到黄昏到星空的渐变,每一条视觉效果要求都兑现了。移动端降级也正确触发:粒子减半,Bloom关闭。


和GPT-5.6 Sol比:Sol的完成度在GPT家族里是最高的,但点击物件时的背景虚化是硬伤。K3不仅没有这个问题,整体的设计审美和氛围感明显高出一个档次。相机转场的平滑度,K3与GPT-5.5相当,但GPT-5.5的配色一言难尽。

这不是「还不错」,这是在3D前端编码这个硬核场景下,开源模型正面击败了当前最强闭源模型。

但代价是时间和钱,这个项目K3跑了接近一个小时,是我们今天所有测试中耗时最久的一项。而且5小时的使用额度如奶油般化开,根本不够用。移动端也出了点小问题,画面排布有瑕疵,因为plan额度已经见底,没法继续优化。

需求矛盾判断:逻辑没问题,但UX跑偏了

第三个测试考察K3的推理和判断力,我们设计了一个智能宠物寄养平台的12条需求文档,散落着至少六组矛盾:实时监控和禁止摄像头的冲突、寄养师限容和紧急加塞的矛盾、熟人免审查的安全漏洞、包月套餐和超时不扣费的逻辑漏洞、退款锁名额和可人工解锁的一致性矛盾、高可用和例行维护的窗口期冲突。


K3在开工前完整列出了所有矛盾,每组都给了推荐处理方案。确认后生成的系统代码功能完善,但界面更像一个开发者的后端管理面板,不是给普通用户用的。


让K3补了一个用户端界面后,从预约到付款的完整流程、宠物实时情况查看,功能全部到位。


这里有一个值得注意的倾向:K3的逻辑分析能力过关,能发现需求中的结构性冲突并给出合理方案。但在UX判断上,它默认生成的界面偏技术化,更像开发者后台而非普通用户产品。这一点和它「训练重点优化了长程高难任务」的定位吻合,它更擅长处理逻辑而非猜测普通用户的审美和交互预期。

竞态条件Bug调试:精准命中

第四项测试是一段简易文件同步引擎的Node.js代码,Bug是分布式系统中的经典难题:多设备同时编辑同一文件并同步时,时间戳被用作唯一冲突裁决依据,导致旧版本可能覆盖新版本。

K3精准定位了根因:handleRemoteChange方法中remoteFile.timestamp>local.timestamp是唯一裁决条件,没有考虑版本向量的情况。在一个设备先完成上传、另一个设备晚完成但基于更旧版本编辑的场景下,时间戳更新但内容过期,覆盖就发生了。

修复方案引入了三档权限scope(admin、finance、public),并补上了正反顺序的回归测试。没有选择关闭缓存或按用户拆分这两种更粗暴的方案。第一版后端生成没问题,但前端映射出了bug,一轮修复后解决。


这和硅星人测的权限缓存Bug结论一致:K3在中小型代码库中的调试能力扎实,能找到结构性问题而非只修symptom。

长程Agent定价分析:数据严谨,不编造

第五项测试考核长程Agent任务:自主搜集AI编程工具的定价信息,整理对比表格,做策略分析,输出结构化报告。涵盖了Copilot、Cursor、Claude Code、ChatGPT、Kimi Code、通义灵码等至少七个竞品。

K3在Kimi Code里完成了这个任务,所有定价数据标注了来源和日期,没有编造价格。分析报告区分了「量贩路线」和「溢价路线」两种策略,对K3自身定价在市场中的位置做了比较客观的定位。做得最好的一点是,在两个竞品之间做了同场景cost simulation,比如完成一个中等前端页面的预期花费对比。


最后还生成了可交互的HTML网页版报告,前端的审美相比Kimi上一个版本有了明显进步,Kimi还主动在报告里面加了一个成本模拟器。如果说有什么遗憾,就是这个任务更适合在Kimi Work里跑,Code环境对「搜索、抓取、整理、可视化」这条流水线的支持不如Work原生。


禅意茶室:证明它能克制

社区刷屏的demo几乎全是重型视觉:霓虹、粒子、爆炸、光晕、全息投影,我们想验证K3能不能做「少即是多」的设计。

这次的要求是日式侘寂美学,极简克制,只允许三种颜色(米白、炭灰、铜绿),动效只限于淡入淡出和微小位移,禁止任何重型特效。评判标准很主观但很明确:这个设计给一个日本茶道老师傅看,他应该觉得还算得体,而不是「AI做的吧」。


让人欣慰的是,K3真的克制住了。没有霓虹闪烁,没有粒子效果,首页大量留白,细线和阴影制造层次。日式日历组件用了和历标注,茶席可选里千家和表千家流派。选了茶席和茶师后,生成了一封日式竖排书信风格的茶会邀请函。双端适配也正常,移动端没有出现元素堆叠。


初始版本有一个卡片无法关闭,一轮修复后解决。总体上说,K3在这个案例里证明了它有能力做出不是「AI风」的设计。前提是你需要在prompt里给它立规矩,不给它炫技的空间。

台球物理推理:建模合理,可视化翻车

最后一项测试是计算8球台球的最佳开球策略,需要建立简化物理模型,分析白球位置、出杆角度、击球速度、旋转等关键变量,跑至少1000次参数组合模拟。

K3的物理建模抓住了核心变量:摩擦、碰撞恢复系数、旋转对轨迹的影响,没有陷入不必要的复杂度。数值模拟确实跑了1000次参数扫描,结论有数据支撑,解释了为什么职业选手把白球放在偏左10到15厘米处,给出了最佳击球速度范围和旋转策略推荐。


但可视化界面翻车了,生成演示页面时出了bug,经过几轮修复才成功运行。为了验证严谨性,我们让K3把推理过程的公式显示输出,物理推理的进步确实不小,但工程落地的稳定性还有提升空间。

「普通人可能也快用不起最强开源模型了」

K3的API定价明确了月之暗面的新路线:不再靠低价打市场。输入2元每百万token(缓存命中)、20元(未命中),输出100元。输出价格是K2.7 Code的大约4倍,进入了全球前沿模型的定价区间。


作为对比:Fable 5的输出是它的约5倍,Opus 4.8是它的约2.5倍。

和国内同行比:DeepSeek V4 Pro的输出价格只有它的几分之一到几十分之一,GLM-5.2大约是它的三分之一。

套餐这边更扎心。最低档49元每月,不支持K3。要跑K3,至少要99元每月的套餐。而1M上下文是分层开放的,低套餐只能用256K,699元每月的高档套餐才能用到完整的100万token。在我们今天的测试中,甚至要等199套餐的5小时额度重置一次才能跑完所有的测试。


社区里有个数据很说明问题:知名开发者Simon Willison用K3画了一只鹈鹕,花了25美分,16658个输出token。另一位开发者Max Blade写了一局游戏,烧光了20美元。


推理速度也是现实问题,3D浮岛项目跑了接近一个小时。同样的前端任务,Fable 5大约20分钟,多位开发者在X和BestBlogs上报告了类似的2到3倍速度差。这不是「慢了一点」,是差了3倍。如果你是一个需要频繁迭代的前端开发者,这个差距会直接影响你的工作流。


官方坦承了两个重要局限性,这种坦诚值得尊重。一个是历史思考内容敏感:K3在后训练中全程使用思考历史保留模式,Agent框架必须完整回传历史思考内容,中途换模型可能导致质量不稳定。另一个是过于主动:用户意图模糊时,K3会替你做决定,需要在system prompt里给它立规矩。

我们在测试中也反复验证了这两个问题,K3 确实过于主动,在禅意茶室案例中如果不约束配色和动效,它会忍不住往里面加东西。至于「炫技」这个评价,多个独立评测不约而同地提到,UI风格在做了多个case后会让人感觉模版化,看多了能闻出熟悉的味道。这不是贬低,更像是能力溢出带来的副作用

开源模型的「K3时刻」?

过去一年里,开源模型的策略一直是跟在闭源旗舰后面,用更低的价格复现已有能力。K3改变了这件事。它主动把模型规模推向2.8万亿的新上限,去碰100万上下文、长程编程和复杂Agent任务,直接参与下一代模型能力边界的竞争。

社区的反响也印证了这一点,PyTorch联合创始人Soumith Chintala在X上称之为「世界级模型」。前美国AI政策顾问Sriram Krishnan评价这是「对整个行业有重大影响的时刻」。Stability AI创始人Emad Mostaque甚至说了一句很扎心的话:「美国实验室最终会蒸馏中国模型」。


K3是开源模型的里程碑,但还不完全是一个工作台。它的前端编程能力已经是世界级,3D编码在特定场景下能正面击败Fable 5。长程Agent任务表现出色,代码调试扎实,物理推理有模有样。但它还不是一个开箱即用的生产力工具。推理速度慢、额度消耗快、定价门槛高,这三个问题加在一起,让它在「日常替代」这个场景下还不够成熟。

不过K3的出现至少改变了一件事:开源模型不再只是「便宜够用」的代名词,它可以直接争夺能力边界的话语权。

2.8万亿只是一个入场券,模型能不能真正干复杂工程,最终要看使用成本、任务稳定性和真实交付结果。完整权重7月27日开源后,社区会给出更全面的答案。

但至少在2026年7月的这个节点,有一件事已经很清楚:在开源模型和闭源旗舰的前端编程对决中,追赶阶段结束了,接下来是真正的互有胜负。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
我给局长开了3年车,并娶了他的地下情人,新婚夜我才知道赚大了

我给局长开了3年车,并娶了他的地下情人,新婚夜我才知道赚大了

千秋文化
2026-06-26 20:00:22
重磅:乌克兰摧毁俄罗斯最大的乌斯季卢加港口!

重磅:乌克兰摧毁俄罗斯最大的乌斯季卢加港口!

项鹏飞
2026-09-01 19:04:48
著名地质学家、中国科学院院士李廷栋逝世

著名地质学家、中国科学院院士李廷栋逝世

澎湃新闻
2026-09-02 12:28:37
吃相难看!王新军去世仅1天,荒谬一幕出现,秦海璐也被牵连

吃相难看!王新军去世仅1天,荒谬一幕出现,秦海璐也被牵连

林轻吟
2026-09-02 19:33:26
欧美挖的比特币大坑,中国绕着走过去了,回头一看坑里都是自己人

欧美挖的比特币大坑,中国绕着走过去了,回头一看坑里都是自己人

尘世闲云
2026-09-01 05:12:01
斯科尔斯:恩佐改变了我对他的看法,他去曼城断送了切尔西争冠希望

斯科尔斯:恩佐改变了我对他的看法,他去曼城断送了切尔西争冠希望

小犙拍客在北漂
2026-09-02 15:11:33
52岁徐静蕾近况曝光!和父母住洛杉矶,开了中文书店,不化妆身材圆润

52岁徐静蕾近况曝光!和父母住洛杉矶,开了中文书店,不化妆身材圆润

小徐讲八卦
2026-09-01 07:21:53
76岁出狱,前妻儿子全没来,唯有小28岁的“小姨子”苦等18年

76岁出狱,前妻儿子全没来,唯有小28岁的“小姨子”苦等18年

北纬的咖啡豆
2026-08-25 07:10:22
曼联夏窗总结!中场完成重建,前锋+后卫0引援,4大金刚无一离开

曼联夏窗总结!中场完成重建,前锋+后卫0引援,4大金刚无一离开

体育知多少
2026-09-02 07:14:43
景甜稳住了!8月30日杭州的公开活动,让大众看见另一种应对风波的姿态,网友:不知道为啥,就是喜欢这姑娘

景甜稳住了!8月30日杭州的公开活动,让大众看见另一种应对风波的姿态,网友:不知道为啥,就是喜欢这姑娘

火山詩话
2026-09-01 17:06:48
尘埃落定!央媒已官宣刘国梁新身份,贪腐被带走传闻终究真相大白

尘埃落定!央媒已官宣刘国梁新身份,贪腐被带走传闻终究真相大白

顾蔡卫
2026-09-02 12:23:27
越扒越有!孙宇晨男牙医自曝“被白嫖”全过程,网友看后叹为观止

越扒越有!孙宇晨男牙医自曝“被白嫖”全过程,网友看后叹为观止

嫹笔牂牂
2026-09-02 07:13:22
太卷了!河北一幼儿园小班的名单登上热搜,网友:感觉全班都是大文豪

太卷了!河北一幼儿园小班的名单登上热搜,网友:感觉全班都是大文豪

火山詩话
2026-08-30 07:44:51
4年2.75亿!浓眉摊牌了!最快速度申请交易

4年2.75亿!浓眉摊牌了!最快速度申请交易

篮球教学论坛
2026-09-02 16:44:59
越南的小心思够精明!这次吉尔吉斯斯坦举办的上合组织峰会,越南没派最高领导人出席,只让国家副主席带队参会,比起去年明显降了半格

越南的小心思够精明!这次吉尔吉斯斯坦举办的上合组织峰会,越南没派最高领导人出席,只让国家副主席带队参会,比起去年明显降了半格

扶苏聊历史
2026-09-01 15:15:37
广东队没送别杜润旺,让球迷质疑有矛盾,或许宏远在等时机

广东队没送别杜润旺,让球迷质疑有矛盾,或许宏远在等时机

只扣篮的教练
2026-09-02 14:30:58
每月领着企业退休金,医保却是居民医保!这批老职工该何去何从?

每月领着企业退休金,医保却是居民医保!这批老职工该何去何从?

你在偷看谁
2026-09-02 19:46:22
“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

LULU生活家
2026-09-01 17:28:22
国家级院士提醒:过了60岁,体检主要查这6项,别随便乱查

国家级院士提醒:过了60岁,体检主要查这6项,别随便乱查

路医生健康科普
2026-07-10 20:35:03
回旋镖来了,丑化宇航员?清华美院副教授丁荭遭画风反噬

回旋镖来了,丑化宇航员?清华美院副教授丁荭遭画风反噬

聚焦真实瞬间
2026-09-02 11:37:59
2026-09-02 20:51:00
光子星球 incentive-icons
光子星球
细微之处,看见未来!
1633文章数 2152关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

10万级的满配B级车 试驾2027款比亚迪海豹06

态度原创

手机
旅游
家居
教育
艺术

手机要闻

泄露的iPhone 18 Pro卡托零部件暗示将推出三种机身配色 或再次取消黑色

旅游要闻

北京师范大学“九寨青禾”暑期实践队走进九寨沟景区和大录乡开展调研

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

随州一中2026年秋季开学典礼隆重举行

艺术要闻

明代隐藏的“草书奇才”!水平不输张旭、怀素,当今知道他的人不足1%

无障碍浏览 进入关怀版