昨晚 Kimi K3 发布后,我看到参数量真的很意外,当时有点激动,随口发了一条推。
![]()
我个人也不喜欢天天震惊体,而且我很少用「震惊」形容一个模型,之前今年唯一的一次,是在吐槽 GPT 5.6 的极丑审美,那个丑是真的震撼到我。
![]()
其实我最大的意外是,K3 的模型参数已经来到了 2.8T,我原以为这个参数规模的开源模型,要等到 Q4 才会有,因为这是很多国内模型下半年最重要的计划,而 Kimi 在 7 月中旬已经训练完成了(通常实际训练完成的时间比发布时间更早,很有可能是在 6 月就训练完成的)。
有人从推理速度和价格推断,Opus 模型的参数量大约是 2.5T,马斯克有一次说大概是 5T,都不一定准确,但大概率就是在 2-5T 之间,GPT 5.6 Sol 也差不多这样,大差不差。
而 Mythos/Fable 明显是 next level 的模型参数量,很多人预估接近 10T,估计下个月发布的 GPT 6 也会差不多。
所以我说,K3 这个参数量,已经达到了 Opus 的级别,代表了中国开源模型追平了今年年初 Opus 4.5/4.6 的参数量。也就是说中国模型距离世界一线开源模型的差距,可能缩短到了半年左右。
训练超大参数模型这件事绝非易事,预训练做大,除了需要很多钱之外,还需要充足的算力是多次的试错,参数量翻1倍,训练成本和风险可能要翻3倍。一次训练崩掉,数千万美元可能就蒸发了。
这就是为什么 K3 的发布,意义是非常重大的,因为在今年上半年, Opus 是一座高山,人人都说超越 Opus,但要真正超越 Opus,2T 以上的参数几乎是必须的,全球能把模型训练到这个规模的公司也是一只手能数的过来的。
K3 是第一个有望全面对齐甚至在部分领域超越 Opus 的开源模型。
如果真的如此,那 K3 就把大模型两个代差缩短到了一个代差。
这也是为什么我会说,Kimi 接下来的模型,是要照着 Fable 去了。
越过一座山丘,望向下一座更高的山,next level。
模型的指标方面,其实业界都知道指标意义没那么大,看看就好,相对和体感比较共识的是 AA 的指标,Kimi K3 排名第三,能和世界顶级的两个模型 Fable 5 和 GPT 5.6 Sol 掰掰手腕。
![]()
一个模型的真实能力,最终还是得放到真实的复杂项目里实测一段时间才能给出论断,所以姑且再用几天再给出结论。
像 Coding 和 Agent 这类的的指标相对客观,大家可以参考一些指标来做判断,不过在 Coding 之外,我确实还有三个特别关心的点。
第一个我在意的点是模型的独立思考。
这个我真的很 care,模型本来就有幻觉,很容易顺着人的话往下走,这样的模型会给人也造成很大的幻觉。
比如我们把一句有争议的话,放到美国豆包 Gemini 里试试
![]()
emmm,就很美国豆包,用更通俗的话来说,就是极度谄媚。
我们再放到 Kimi K3 里试试,模型明显在以独立思考的方式来判断,并且指出了这句话的盲区。
![]()
在此之前,独立思考最强的模型是 Opus,连 GPT 5.6 都有一点略带迎合。
第二个我在意的点是模型的文字驾驭能力。
虽然大家都知道 coding 是第一生产力,但程序员这个群体的 AI 渗透率已经很高了,人群也就那么少,Agent 最终突破 DAU 还要靠白领,白领的工作里就是有很多文字工作。
之前的开源模型,在 coding 方面有些能达到 Opus 水平,但没有一个能在写作方面接近。
要写好一篇文章,比想象的更难,因为缺乏明确的奖励信号,也没有人专门去训练这方面的能力(相比 coding,ROI太低了),一般都是靠模型参数和语料的 scaling 自然变好。
现代模型都太厉害了,写的文章信息密度过高了,看起来都很难受,我想到可以让他们写散文来测试文风。
这是我让 K3 和 GPT 5.6 Sol 对同一个主题写的一篇散文,都让他们写完之后第一版之后反思 AI 味儿再写第二版。
先看看 K3 写的
![]()
散文写得很有画面感,不是流水账也不是议论文,同时一些词的用法非常之地道。
下面这篇是 GPT 5.6 写的,可以对比感受下。
![]()
另外令人意外的是在海外的英文写作评估中,Kimi K3 竟然超过了 Fable 5,这也是第一次有开源模型成为写作领域的第一。
![]()
第三个我在意的点,就是模型的产品设计能力和工程能力。
在用 K3 的时候,我能明显感觉到模型的「雄心」,它具备自主规划长程任务,且不怕给自己找麻烦的能力倾向。
我让它基于1000条笔记做一个笔记成长看板,它发现我没给它笔记之后,为了真实模拟,先给自己安排了任务,生成了1000条笔记(这种认真的态度大为震撼)。
![]()
在设计看板时,它自己规划了超过5种成长系统的展现方式,这些都不是我要求的,是它主动给自己加的难度。
在进行风格设计方面,只需要说清楚参考标的,整个网站的风格都会自主设计,并且遇到素材不足时,会自动创建素材。
这是成品的视频演示,审美也是极好的,我给的参考是几个游戏的名字,它自己总结的风格是「 冒险手帐风」。
海外那边,Arena 的前端盲测,Kimi K3 甚至超过了 Fable 5 成为最强前端模型,可见审美的调教很有水平。
![]()
价格方面,Kimi K3 对齐了 Sonnet,是 Opus 的三分之二,我认为是个公允的定价,但直接用 API 一般人消费不起,还是建议大家去买个 Coding Plan 来用,根据我对国内算力的预估,这个很快也会和 GLM 一样限购。
总而言之,Kimi K3 是综合模型实力达到世界第一梯队的模型,也 已经成为我日常的模型选择之一, 值得在真实的项目里多试试。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.