让AI处理25000条Slack消息和3500封邮件,再生成一份董事会PPT——这种真实的办公场景,最近成了评测大模型智能体能力的新标准。独立评测机构Artificial Analysis在7月22日更新的AA-Briefcase智能体知识工作基准中,月之暗面的Kimi K3模型跑出1543分,压过GPT-5.6 Sol(1501分),仅次Claude Fable 5(1574分)。
AA-Briefcase是2026年6月才推出的前沿AI智能体基准,专门模拟企业中混乱、碎片化的长周期工作。它不搞那些回答选择题的评测,而是让模型面对数据科学、产品管理、企业战略等真实任务:读懂海量邮件和聊天记录,整理会议纪要,最终输出Excel财务模型或董事会汇报PPT。正因为考试内容够“脏”、够贴近上班族的日常,这个榜单的成绩更能反映模型在知识工作里的实用水平。
![]()
从得分看,Kimi K3的1543分已经把一批知名模型甩在身后。除了超过GPT-5.6 Sol,它还明显领先于Claude Sonnet 5(最高1388分)和Claude Opus 4.8(最高1347分)。相比之下,Kimi K3的上代产品Kimi K2.6在这个榜单上只有816分,跃升幅度相当明显。用一句话概括:Claude Fable 5暂时守住第一,但Kimi K3已经挤到了OpenAI旗舰模型的前面。
Kimi K3是月之暗面在2026年7月16日上线的旗舰模型,参数规模达到2.8万亿,上下文窗口100万Tokens。官方强调它尤其擅长编程、游戏/3D和知识类任务。
编程上的表现也有佐证——在Frontend Code Arena前端基准测试中,Kimi K3曾以1679分登顶,超过Claude Fable 5,并且在品牌营销、数据分析等七个前端领域里拿下六个第一。
模型定价走的是按量计费路线。输入100万Tokens,缓存命中时只要2元,未命中时20元;输出100万Tokens收费100元。这个价格策略定位在中高端模型市场,如果能保证推理效率,对开发者来说会有不小的吸引力。
更大的想象空间来自微软。近期有报道称,微软正在内部测试Kimi K3,评估将其部分接入Copilot AI助手的可行性,主要目的是降低推理成本。如果最终落地,Kimi K3可能会变成巨头生态里的一枚重要棋子,这也意味着中国大模型在商业化落地上又多了一条深入海外市场的通路。当然,目前还处在内部评估阶段,后续怎么谈、谈成什么样,仍然存在变数。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.