网易首页 > 网易号 > 正文 申请入驻

原生掌握“边思考,边用工具”,Kimi “史上最强”开源思考模型能否破局AI红海?

0
分享至

月之暗面今年以来的技术迭代还在继续。

11月6日晚间,月之暗面旗下Kimi大模型发布了Kimi K2 Thinking,并称其为“Kimi迄今能力最强的开源思考模型”。

Kimi官方表示,Kimi K2 Thinking是基于“模型即Agent(智能体)”理念训练的新一代Thinking Agent,它原生掌握“边思考,边使用工具”的能力。

从实测成绩来看,Kimi K2 Thinking在“人类最后的考试”(Humanity's Last Exam)、自主网络浏览能力(BrowseComp)、复杂信息收集推理(SEAL-0)等多项基准测试中表现达到SOTA(当前技术水平的最前沿)水平。

自7月进入“K2”版本之后,Kimi的升级正在提速。9月5日,Kimi发布Kimi K2模型的最新版本“0905”,进一步提升其在真实编程任务中的表现。9月25日,月之暗面Kimi发布全新Agent模式“OK Computer”并开启灰度测试。

这也是整个AI市场的一个缩影。事实上,AI市场正进入快速迭代阶段。据QuestMobile发布的2025年三季度AI应用行业报告,以头部互联网集团为例,今年1月—9月共完成182次模型发布/更新/迭代,平均每5.7天就迎来一次模型升级。

模型迭代节奏持续加快,技术竞争正转向应用能力与推理深度的实战较量。

在“人类最后的考试”中超越GPT-5(High)

据Kimi官方,Kimi K2 Thinking是“Kimi迄今能力最强的开源思考模型”,这一定位源于其在技术架构、任务执行与评测表现上的系统性突破。

作为基于“模型即Agent”理念训练的新一代Thinking Agent,Kimi K2 Thinking实现了“边思考,边使用工具”的原生能力融合。该模型可在无人干预的情况下,自主完成多达300轮的工具调用与多轮思考,可提升处理复杂问题的连续性与稳定性。

在多项关键能力维度上,Kimi K2 Thinking均有明显进步,其Agentic(智能代理)搜索、Agentic编程、写作与综合推理性能得到进一步强化。

在推理能力方面,该模型在涵盖100多个专业领域的“人类最后的考试”(Humanity's Last Exam)中取得了卓越成绩。该测试允许使用搜索、Python及网络浏览等工具,Kimi K2 Thinking以44.9%的得分达到SOTA水平。作为对比,Kimi公布的同场测试中GPT-5(High)的成绩为41.7%。

面对信息过载的复杂搜索场景,Kimi K2 Thinking同样表现出色。BrowseComp测试旨在评估AI在信息密集环境中的坚持性与创造力。在该项测试中,人类平均得分仅为29.2%,而Kimi K2 Thinking以60.2%的成绩刷新了SOTA纪录。

此外,该模型在编程相关任务中亦有稳步提升。在多语言软件工程基准SWE-Multilingual、SWE-bench验证集以及Terminal终端使用等测试中,其表现有了进一步提升。

除了专项能力的突破,Kimi表示Kimi K2 Thinking模型在通用基础能力上也实现同步升级。无论是在创意写作、学术研究,还是在回应个人与情感类问题时,模型都展现出更成熟的理解与表达能力。

为进行对比验证,《每日经济新闻》记者使用与测试Kimi K2时相同的提示词,要求Kimi K2 Thinking模型以2025年北京高考作文题“数字闪耀时”为例,模拟高中生身份完成一篇一类记叙文。从结果看,文章结构完整、扣题准确,但在切题方式上,该模型与K2一样,仍存在表达略显生硬的情况。


打开百度APP畅享高清图片

使用了长思考模式的Kimi撰写的作文图片来源:Kimi网页版截图

目前,Kimi K2 Thinking模型的API(应用程序编程接口)已在Kimi开放平台正式上架,支持256K上下文长度,定价与Kimi K2-0905相同:每百万Token(大模型处理文本时的最小单位)输入收费4元,输出16元,若命中缓存,输入费用仅为1元。同时,平台也推出了生成速度高达100 Token/s的Turbo API,其每百万Token输入为8元,输出58元,命中缓存的输入同样为1元。

Kimi能否破局“红海”竞争

然而,技术优势能否成功转化为市场认可,是摆在Kimi K2面前的首要挑战。

QuestMobile数据显示,今年三季度,接近60%的原生App陷入负增长,对于新入局者或中小应用而言,独立打造一款成功的原生App的窗口正在收窄。2025年,国内大模型竞争已从初期的“百花齐放”步入“巨头主导”的新阶段。

Kimi自身的增长也面临压力。

根据量子位智库10月数据,在AI助手APP新增下载榜上,Kimi与DeepSeek分别以超420万和360万的下载量位列第三、四位,但相较9月,两者的下载量均下滑超过13%。与此同时,字节跳动的“豆包”以近2800万新增下载稳居第一,腾讯“元宝”则以超1300万下载、环比14%的涨幅位列第二。大厂凭借其生态优势,持续挤压着独立应用的生存空间。

并且,更多跨界玩家正依托自身业务场景加速入局。11月3日,美团LongCat(龙猫)团队宣布推出全新开源大模型LongCat-Flash-Omni,这也是美团在两个月内第四次发布新模型。

另一个行业信号是AI交互成本的下降。

QuestMobile在报告中表示,人均单次Token消耗的下降也标志着AI行业进入了一个以“效率提升、成本控制、价值驱动”为特征的新阶段。这是行业走向成熟和商业化的关键信号。

在此背景下,今年以来的Kimi正尝试通过垂类合作探索商业化路径。今年“双11”期间,《每日经济新闻》记者测试发现Kimi更新了“导购”功能,可根据用户需求推荐商品并附带淘宝或京东链接,不过商品多来自代理店铺,尚未与官方旗舰店打通。相较于字节“豆包+抖音”、阿里“通义+电商”的生态闭环,Kimi暂未形成同等强度的业务绑定。

数据表明,具备清晰场景的垂直类AI应用仍具有增长潜力。据QuestMobile,字节跳动旗下即梦AI、豆包爱学及蚂蚁集团旗下AQ健康管家等垂类应用三季度月活跃用户规模复合增长率分别达12.1%、15.7%和83.4%。

对Kimi而言,差异化的核心在于将模型能力转化为用户可感知的价值。其能否在Agent搜索、编程助手、深度研究等场景建立起不可替代性,将决定技术升级的市场成效。

Kimi K2 Thinking展现出的技术纵深,为月之暗面在“思考型Agent”这一差异化路径上赢得了重要筹码。然而,在白热化的大模型竞争中,技术领先性只是入场券,能否将“长思考”“强推理”的模型能力,转化为用户高频依赖的应用场景,并构建起可持续的商业模式,才是真正的破局关键。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
拼尽全力!广东女篮全运会夺冠

拼尽全力!广东女篮全运会夺冠

新快报新闻
2025-11-15 21:31:02
抛弃电池回归纯油!新车发布,这才叫“顶级颜值”

抛弃电池回归纯油!新车发布,这才叫“顶级颜值”

娱乐圈的笔娱君
2025-11-16 02:24:01
曾琦,女,1981年出生,博士,主任医师,副教授

曾琦,女,1981年出生,博士,主任医师,副教授

岁月有情1314
2025-11-09 09:56:33
央视选了合资车,行业炸锅了,标准革命悄悄来了

央视选了合资车,行业炸锅了,标准革命悄悄来了

三农老历
2025-11-15 01:40:27
日本专家曾声称:日本军事能力足够强!一旦开战,中国占不到便宜

日本专家曾声称:日本军事能力足够强!一旦开战,中国占不到便宜

温辞韫
2025-11-03 10:46:59
上海,全域放开限购?

上海,全域放开限购?

新浪财经
2025-11-15 18:07:27
8.5个亿的人民币说放弃就放弃了?神舟二十号飞船为何被放弃

8.5个亿的人民币说放弃就放弃了?神舟二十号飞船为何被放弃

元爸体育
2025-11-16 02:04:25
11月15日俄乌:又一次最远的袭击

11月15日俄乌:又一次最远的袭击

山河路口
2025-11-15 17:58:55
1996年,谭咏麟向妻子提出:10亿家产全部给你,只要让我儿子回家

1996年,谭咏麟向妻子提出:10亿家产全部给你,只要让我儿子回家

百态人间
2025-11-10 16:21:41
印度游客在庐山搓澡,把景区当恒河?扎堆来华旅游,景区回应来了

印度游客在庐山搓澡,把景区当恒河?扎堆来华旅游,景区回应来了

鲸探所长
2025-11-15 19:38:07
退守四行仓库后,37岁谢晋元随即身亡,蒋介石:他的部下背叛了他

退守四行仓库后,37岁谢晋元随即身亡,蒋介石:他的部下背叛了他

史笔似尘钩
2025-11-12 13:33:04
比亚迪豁出去了!大SUV跌至7.8万,续航1360km+高阶智驾,真厚道

比亚迪豁出去了!大SUV跌至7.8万,续航1360km+高阶智驾,真厚道

沙雕小琳琳
2025-11-15 12:40:33
中方直接掀了桌,27国不许用华为,“5G之战爆发”,先拿德国开刀

中方直接掀了桌,27国不许用华为,“5G之战爆发”,先拿德国开刀

趣文说娱
2025-11-15 14:11:13
得罪足协,克劳琛称若没有足协干预,05年国青至少能进两届世界杯

得罪足协,克劳琛称若没有足协干预,05年国青至少能进两届世界杯

体坛风之子
2025-11-15 04:30:03
孙悟空为何不学更强的36变?不是他不想学,你看猪八戒是怎么说的

孙悟空为何不学更强的36变?不是他不想学,你看猪八戒是怎么说的

掠影后有感
2025-11-15 11:12:23
86岁刘诗昆嘴歪了!带第3任妻子和5岁女儿现身香港一富裕人家演奏

86岁刘诗昆嘴歪了!带第3任妻子和5岁女儿现身香港一富裕人家演奏

小娱乐悠悠
2025-11-13 10:25:54
知道董璇为啥敢嫁张维伊了,反转还挺大,张维伊也让人刮目相看了

知道董璇为啥敢嫁张维伊了,反转还挺大,张维伊也让人刮目相看了

萱小蕾o
2025-09-21 09:37:55
不瞒了!马筱梅挺大肚直播,食欲大增超爱吃肉,张兰:别太辛苦

不瞒了!马筱梅挺大肚直播,食欲大增超爱吃肉,张兰:别太辛苦

小海娱计
2025-11-14 14:08:43
荒野求生冷美人晕倒退赛,林北状态好到出奇:头戴花环和女友庆生

荒野求生冷美人晕倒退赛,林北状态好到出奇:头戴花环和女友庆生

阅尽
2025-11-14 17:13:04
钾是香蕉的21倍,建议中老年人,隔两天吃一次,腿脚有劲,精神好

钾是香蕉的21倍,建议中老年人,隔两天吃一次,腿脚有劲,精神好

秀厨娘
2025-10-31 19:48:46
2025-11-16 03:56:49
每日经济新闻 incentive-icons
每日经济新闻
中国主流财经全媒体平台。
1402358文章数 2720014关注度
往期回顾 全部

科技要闻

撕掉流量外衣,小米还剩什么?

头条要闻

大量日本民众围堵首相官邸 大喊:高市早苗下台

头条要闻

大量日本民众围堵首相官邸 大喊:高市早苗下台

体育要闻

樊振东和他的尖子班 勇闯地表最强乒乓球赛

娱乐要闻

钟嘉欣婚变风波升级!被骗婚?

财经要闻

小米之“惑”

汽车要闻

"冰彩沙"全配齐 红旗HS6 PHEV预售17.88万起

态度原创

教育
时尚
本地
数码
军事航空

教育要闻

天塌了啊:英国大学又开始搞大裁员了!

有品味的中年女人,穿衣都有4个共同点,看看你掌握了几个

本地新闻

沈阳都市圈“冷资源”点燃“热联动” “组团”北上“圈粉”哈尔滨

数码要闻

华为Mate 80全系支持3D人脸识别,同期还有高端“二合一平板电脑”

军事要闻

解密福建舰电磁弹射背后的硬核支撑

无障碍浏览 进入关怀版