网易首页 > 网易号 > 正文 申请入驻

一百万Token之外,Kimi K3开始学习“暂停”

有Token的我 VS Token用完的我

0
分享至


让Agent停下来,再接着做

作者 | 许有阳

来源 | 盒饭财经(ID:daxiongfan)

头图及封面来源 | codex

月之暗面兑现了11天前留下的欠条。

7月16日,月之暗面发布Kimi K3时,模型已经进入Kimi.com、Kimi Work、Kimi Code和API。当时,其官方表示,完整模型权重不晚于2026年7月27日落地。

上周,盒饭财经在一文中,讨论了长线程为什么正在成为前沿模型的新战场。而这是月之暗面第一次系统披露,K3面向超长Agent任务的训练和运行机制。

27日晚,在DDL前,月之暗面踩点正式开放权重。这一次,完整模型权重正式上线Hugging Face,47页技术报告、模型配置与Kimi K3 License也同步出现在GitHub模型仓库中。另外,MoonEP与AgentENV也随之开放,4月已经开源的FlashKDA也被纳入完整技术栈。


然而,在这次公开的内容中,最能解释K3的数字,并不是最显眼的参数量和上下文窗口。

技术报告称,训练与评测期间一共创建了51,219,741个沙箱,涉及1,505,678种镜像。同时,沙箱可能将高达98%的生命周期花在等待模型推理,月之暗面因此让它暂停时释放CPU和内存,再在最低49毫秒内恢复。

什么意思?

训练一个能使用工具的Agent,不只是让模型在GPU里生成答案。每当Agent需要安装软件、修改文件或者运行测试,系统都要为它准备一台相互隔离的“临时电脑”。技术报告中的“沙箱”,就是这样的工作环境;而“镜像”则相当于预装了不同操作系统和软件组合的环境模板。

5122万个沙箱是K3训练和评测期间累计创建的工作环境。150多万个镜像,也从侧面反映出这些任务涉及的软件环境和依赖组合极为多样。

于是,问题来了,沙箱最高有98%的时间是在等待模型给出下一步指令,如果这些环境一直开着,就会持续占用CPU和内存。AgentENV的办法是把等待中的环境暂时冻结并释放资源,等模型返回后,再恢复原来的文件、内存和运行状态。月之暗面官方公布的最低恢复时间为49毫秒。

换句话说,K3处理的不只是“模型能思考多久”,还有模型暂停思考时,那间已经工作了一半的“办公室”能不能先关灯,醒来后又保持原样。

这指向了Agent时代的新问题。

上下文窗口解决的是,模型一次能带着多少资料工作,而长线程解决的是,这项工作怎样不断线。这些意味着,任务运行十几个小时后,模型还要记得最初目标;意味着等待测试或人工审批时,系统不能一直占着算力;还意味着,机器或网络中断后,已经修改的文件和正在运行的进程也不能消失。

100万Token,也只是把“桌面”变大。

100万Token,仍然装不下一项工作

从7月16日的产品发布到7月27日的正式开放,K3补齐了一条从模型到基础设施的链条。


这里需要先区分“开放权重”和“完整开源”分别意味着什么。K3官方将其定义为开放权重模型:外部开发者可以下载和部署模型,但训练数据、奖励模型和完整训练流水线并未全部公开。

开放权重意味着外部开发者可以下载训练完成的模型,自己部署或继续微调。但,它不代表训练数据、奖励系统和全部训练代码都已公开。

根据Kimi K3 License,许可证设置了两类商业条件。对于符合定义的MaaS经营者,如果关联主体连续12个月合计收入超过2000万美元,需要另行取得商业协议;如果搭载K3的商业产品月活超过1亿,或月收入超过2000万美元,则需要在产品中显著展示“Kimi K3”。

MoonEP、FlashKDA和AgentENV则采用限制更少的MIT许可证,社区可以较自由地使用和修改这些基础设施。

据了解,MoonEP、FlashKDA和AgentENV对应的是K3运行链条上的不同环节。MoonEP处理MoE训练中的专家并行通信与负载均衡,FlashKDA提供Kimi Delta Attention的高性能计算算子,AgentENV则负责创建、隔离和恢复Agent使用的沙箱。

换句话说,月之暗面这次公开的不只是“大脑”,还包括让它训练、计算和工作的部分基础设施。

也就是说,K3完成了开放权重,并把相当一部分关键基础设施送进开源生态。权重落地后,外界可以进一步核验模型文件、架构配置,并尝试独立部署和复现。

K3共有2.78万亿参数,但每次处理一个Token时只调用其中约1042亿参数。同时,它拥有1,048,576 Token上下文,并从训练早期就同时学习文本与视觉信息。

这100万Token也不是在训练最后把上下文窗口直接拧到最大。

K3先在8K、64K等较短文本上训练,进入后期后再从256K扩到1M。而月之暗面还合成了一批需要在百万Token中寻找分散线索的任务。技术报告同时提醒,窗口变长不等于模型自然学会处理长任务。


K3首发时展示的芯片设计任务,提供了一个更直观的时间刻度。一个早期版本在一次48小时自主运行中,使用开源EDA工具和Nangate 45nm工艺库,完成并仿真验证了一套用于其自身架构微型模型的芯片设计。

这并不意味着模型连续生成了48小时文本。技术报告确认,它在Kimi Code中使用EDA工具,依次完成设计、优化和验证;从系统结构看,整个过程由模型推理、工具执行和结果回传交替组成。一条任务就这样在模型、工具和环境之间持续了两个昼夜。

这也是100万Token解决不了全部问题的原因。

窗口可以保存模型看过的信息,却不会自动保存正在运行的测试、已经安装的依赖和被修改的文件。参数决定模型有多大,窗口决定它一次能看见多少,而那5122万个沙箱提出的是另一个问题:任务停下之后,现场还在不在?

同一项工作,四种“接着做”

晚上十点,你把代码仓库和问题单交给一个编程Agent。它先阅读文件、安装依赖并复现问题,随后修改代码、运行测试。第一次测试失败后,它继续读取日志,准备第二轮修改。

如果任务半小时内结束,这些动作或许都能留在同一轮对话里。但时间继续向后走,新的问题会依次出现:凌晨一点,上下文即将写满;凌晨两点,Agent改坏了代码;凌晨三点,运行节点突然故障;第二天上午,流程又停在等待人工批准的步骤。

这时需要保存的,已经不只是聊天记录。


面对这个问题,OpenAI的解题思路是,首先处理上下文写满的问题。

GPT-5.1-Codex-Max接近窗口上限时,会启动一种名为“上下文压缩”的机制。在这套机制中,系统整理此前的交互,留下它判断重要的内容,再把这份精简历史交给一个新窗口。

于是,可能就会出现这样的情况。当你凌晨一点上下文用尽时,Agent不必结束任务,它可以带着整理后的进度继续读代码、调用工具。OpenAI称,这是公司第一个被原生训练来跨多个上下文窗口工作的模型,内部评估中观察到过超过24小时的任务。

这条路线解决了“对话装不下”。但它的代价也发生在整理过程里:压缩并非随机删除,但系统必须判断什么重要。从目前公开机制看,被保留和被舍弃的内容主要由系统判断。对用户来说,压缩提高了任务长度,却也带来一个难以直接检查的问题:系统究竟忘掉了什么?

Anthropic的思路是,先解决Agent改错代码怎么办?

Claude Code会在Claude每次修改代码前自动保存一个“检查点”,也就是当时的代码版本和对话位置。如果Agent凌晨两点改坏了支付逻辑,用户可以回到凌晨一点半的代码状态,也可以同时恢复当时的对话,再从另一个方向尝试。

但这个“撤销键”只覆盖Claude的编辑,不覆盖用户自己修改的文件,也不覆盖模型通过终端命令造成的变化。也因此,Anthropic仍建议配合Git等版本控制工具。

代码回到了正确版本,不代表整个任务现场都回来了。安装到一半的依赖、终端里运行的服务和外部工具已经产生的副作用,仍需其他系统处理。

Google处理的则是进程和连接随时可能中断的问题。

快照的概念早就有了。早在1985年,Mani Chandy与Leslie Lamport就提出了分布式快照,研究如何在一套系统继续运行时,记录各个组件处于什么状态。

Google Agent Executor使用事件日志和快照保存可恢复状态。节点故障后,系统可以恢复未完成的任务;客户端断线重连时,也能根据最后收到的序号补回遗漏事件。

打个比方,凌晨三点,运行这个Agent的节点突然故障。借助事件日志和快照,系统可以恢复未完成的执行;如果只是用户电脑断网,客户端重新连接后,还能从上次收到结果的位置补回遗漏事件。

为了避免两个执行器同时更新文件或会话、把状态改乱,同一会话在同一时刻只允许一个执行器写入。Google把这项规则称为“单写入者”(single-writer)机制。

这让任务不会因为机器或网络故障消失,却没有让模型本身更会记忆,也不会替模型发现目标已经漂移。Google保存的是“发生过什么”,而不是训练模型如何跨过一次中断。

微软面对的,则是一项工作本来就需要停下来。

打个比方。

在报销、采购或跨部门流程中,Agent做到某一步后可能要等经理批准。结果或许几分钟后到,也可能几天后才到。Durable Agents会把对话、流程步骤、审批状态和计时器写入长期存储,等待期间释放计算资源。等到批准到达后,系统从下一步继续,这就不用让模型几天不关机。

它可以等待数小时、数天甚至数周,但保存每个会话的记录并不是无限大。微软文档同时提示,在Durable Task Scheduler后端中,单个Agent会话对应的持久化实体状态存在1MB容量上限。随着对话和步骤不断增长,开发者仍需主动压缩或开启新会话。


至此,同一问题的四种不同解法真正显现:OpenAI让对话跨过窗口,Claude让代码跨过错误,Google让运行过程跨过故障,微软让业务流程跨过等待。它们都在帮助Agent“回来”,只是分别保留了不同部分。

当然,多Agent也不能代替这些状态。把任务拆给几个Agent可以提高速度,但协调者仍要知道每个Agent改过什么、文件是否冲突,以及失败后从哪里恢复。并行解决的是同时做,检查点解决的是接着做。

前述四条路线主要回答Agent在实际运行时怎样不断线,其中OpenAI还把跨窗口压缩纳入模型训练。K3的增量则落在Agent强化学习:如果一条工具调用轨迹长到跨过一次训练迭代,未完成的部分是丢掉,还是带着模型缓存和沙箱状态进入下一轮?


“暂停”任务,月之暗面押注工作流

我们把刚才那项“跨夜改代码”场景假设的任务,放大到K3的训练集群里。

现在面对的,是一批任务同时生成多条执行记录。在强化学习中,模型从接到任务、采取行动到获得结果的完整过程,被称为一条“轨迹”;系统根据任务是否完成、结果是否正确,为轨迹计算分数,再用这些结果更新模型。

不同轨迹需要的时间并不相同。有的任务几分钟就完成,有的仍在搜索资料,有的正在编译代码,还有的反复修改后仍未通过测试。

传统同步流程中,本轮轨迹生成通常要等整批结果结束,才能整体进入后续的策略优化。只要最后几条轨迹仍未完成,整个训练流程就可能被长尾拖住。

K3改变了这个顺序。

当完成轨迹达到预设比例后,训练系统就暂停剩余的长尾轨迹,让后续优化先向前推进。被暂停的轨迹不会被判定失败,它会进入队列,在下一轮优先恢复。 月之暗面把这套机制称为partial rollout,即“部分轨迹生成”。

严格来说,决定暂停的是训练调度器。所谓K3“学会暂停”,不是模型主动休息,而是训练系统保留未完成轨迹,随后让模型在原有状态上继续生成。

问题随之而来:一条任务到底要保存什么,才能真正回来?

假设被暂停的Agent已经读过大量代码,安装了依赖,修改了三个文件,测试进程仍在运行。此时只保存聊天摘要,Agent知道自己要修Bug,却会回到一台没有依赖、没有改动的干净机器。如果只保存虚拟机,文件和进程都在,模型却未必记得为什么这样修改。如果只保存全部文字,恢复时又要重新处理几十万甚至上百万Token的历史。

结合K3技术报告和模型卡,可以把它为了“暂停后续跑”所保留的状态,大致归纳为三类。

第一类是任务记录。多轮对话和工具调用时,Agent框架需要把模型此前返回的完整消息再次传回,包括接口此前返回的推理内容和工具调用记录。最先要接上的是任务历史:目标是什么,工具做过什么,模型为什么修改这些文件。

第二类是已经算过的中间结果。模型处理长上下文时,会缓存前文的计算结果,避免生成每个新Token时都从头阅读。文字历史之外,K3还保留已经算过的模型缓存。否则,上百万Token需要重新计算。

第三类是实际工作环境。普通软件容器里的多个任务通常共享宿主机内核。如果Agent执行危险命令,一个任务可能影响整台机器。AgentENV因此没有只用普通容器,而是选择一种更轻量、同时能为每个沙箱提供独立内核的微型虚拟机。

从整个系统看,要让一条轨迹在下一轮继续,训练系统需要接上此前的任务历史,复用仍然有效的模型缓存,并在再次调用工具时恢复相应的微型虚拟机环境。此前安装的依赖、修改的文件和等待中的测试进程状态仍被保留,Agent可以从中断处继续。

等待模型时,系统先记录沙箱的内存和文件变化,再释放CPU和内存;新指令到达后,系统恢复微型虚拟机。此前安装的依赖、修改的文件和测试进程可以从保存下来的状态恢复。发生错误时还可以回到此前快照,需要验证结果时则可以从当前状态复制一个独立环境。

这才是K3所说的“暂停”。

这条路线并非突然出现,它与杨植麟长期关注的长序列问题存在一条清晰的研究脉络。三项工作处理的边界并不相同:Transformer-XL面对文本片段的边界,Kimi k1.5面对输出预算和训练迭代的边界,K3面对的则是长时间Agent轨迹及其运行环境。它们的共同点是,越过边界时尽量不要从头开始。

2019年,杨植麟、戴梓航等人提交Transformer-XL论文。它处理的是阅读边界:模型读完一段文字后,不把此前计算出的内部状态全部清空,而是带着它继续理解下一段。2025年1月,Kimi k1.5把“保留未完成部分”带进强化学习:一条尚未生成完的长回答,可以留下已经完成的内容,下一轮从断点接着生成。

过去,月之暗面试图让模型读完更长的文本,现在,它尝试让模型做完更长的工作。

开放权重之后

这也解释了7月27日正式开放的另一层价值。

7月17日,也就是K3发布的第二天、完整权重尚未落地时,Arena联合创始人兼CEO Anastasios Angelopoulos对媒体称,这“可能是今年最大的一次发布”。而杨植麟在卡内基梅隆大学的导师、曾任苹果AI研究主管的Ruslan Salakhutdinov则把它称为开放模型社区的一次巨大胜利。

当时,外界能够直接观察的主要还是在线产品、API价格和榜单表现。如今权重真正公开,讨论才从“它表现怎样”进入“别人能否运行和改造它”。

K3正式开放,让外界第一次能把模型能力、基础设施与许可证放在一起判断。这一系列的事件,回看后不难发现,月之暗面的技术取向也逐渐清晰:同时保存训练轨迹、模型计算状态和运行现场。

大模型时代争的是一次能读多少。而Agent时代争的或许是,停下来之后,谁还能回到原来的工作里。

参考资料:

1.《月之暗面Kimi K3正式开源》,界面新闻

2.《Kimi K3: Open Frontier Intelligence》,Kimi官方

3.K3模型仓库,https://github.com/MoonshotAI/Kimi-K3

4.K3技术报告,https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf

5.《Distributed Snapshots: Determining Global States of Distributed Systems》,

6.K3 Hugging Face权重页,https://huggingface.co/moonshotai/Kimi-K3

7.K3模型卡,https://github.com/MoonshotAI/Kimi-K3/blob/main/README.md

8.《Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context》

9.《Transformer-XL: Unleashing the Potential of Attention Models》,Google官方

10.Kimi k1.5论文与仓库,https://github.com/MoonshotAI/Kimi-k1.5

11.《Introducing Agent Executor, Google’s distributed Agent Runtime》,谷歌官方

12.《构建更多可能:GPT‑5.1‑Codex‑Max 简介》,OpenAI官方

13.《Enabling Claude Code to work more autonomously》,Anthropic官方

14.《Kimi K3 Is Here: Efficient Day-0 Support on vLLM》,vLLM官方

15.《Durable Task extension for Microsoft Agent Framework》,Microsoft官方

16.Kimi K3 License、MoonEP与FlashKDA,MoonshotAI GitHub

17.AgentENV,kvcache-ai GitHub;K3技术报告称其由团队与合作伙伴共同开发

欢迎在评论区留言~如需开白请加微信:YPYP01234567

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
西班牙飞地局势激化,法国向法西边境增派军队

西班牙飞地局势激化,法国向法西边境增派军队

参考消息
2026-08-01 19:59:25
左宗棠收复新疆用的十三响快枪,火力迅猛难敌,单支价值18两白银

左宗棠收复新疆用的十三响快枪,火力迅猛难敌,单支价值18两白银

夏虫欲饮冰
2026-07-17 11:30:07
北大用“漏电”干翻英伟达A100,快478倍

北大用“漏电”干翻英伟达A100,快478倍

粤语音乐喷泉
2026-08-01 13:46:40
王虹在清华大学讲课竟然还用英文,不用文言文,太不像话!

王虹在清华大学讲课竟然还用英文,不用文言文,太不像话!

廖保平
2026-08-01 09:33:42
从史上最蠢交易到教科书式止损,哈里森只用了一年就完成口碑反转

从史上最蠢交易到教科书式止损,哈里森只用了一年就完成口碑反转

篮球小布丁
2026-08-02 21:13:41
对王树国的举报,已经对福耀科大2026年招生产生了不小的负面影响

对王树国的举报,已经对福耀科大2026年招生产生了不小的负面影响

叒女紫121
2026-07-30 18:16:57
外媒发现不对劲:中国仅用11架歼20,就干掉了印度空军的40年优势

外媒发现不对劲:中国仅用11架歼20,就干掉了印度空军的40年优势

共工之锚
2026-07-30 11:04:24
存款别贪多,五十岁以后达到这三个数额,你的家庭就已经很幸福了

存款别贪多,五十岁以后达到这三个数额,你的家庭就已经很幸福了

平说财经
2026-08-01 06:13:00
退伍后给女富豪当保镖,第一次送她回上亿别墅,她父亲看到我愣住

退伍后给女富豪当保镖,第一次送她回上亿别墅,她父亲看到我愣住

麦子情感故事
2026-08-02 15:32:05
贾乃亮携甜馨东北动物园游玩,13岁女儿手臂淤青令人忧

贾乃亮携甜馨东北动物园游玩,13岁女儿手臂淤青令人忧

原梦叁生
2026-08-02 20:25:42
刘翔的烦恼:上一年耐克的1400万代言费还没花完,今年又到账了

刘翔的烦恼:上一年耐克的1400万代言费还没花完,今年又到账了

喜欢历史的阿繁
2026-08-02 00:14:45
国内一化工巨头,亏损已超70亿!

国内一化工巨头,亏损已超70亿!

新浪财经
2026-08-02 19:13:14
和讯信息曾宇豪:科技股阶段底部,但接下来的主角可能是AI应用

和讯信息曾宇豪:科技股阶段底部,但接下来的主角可能是AI应用

和讯网
2026-08-02 19:31:02
砸460亿美元,特朗普再下死命令:明年起一颗中国稀土都不许用!

砸460亿美元,特朗普再下死命令:明年起一颗中国稀土都不许用!

菁菁子衿
2026-08-01 11:03:59
3540万印度人外流西方,西方收紧移民,会转头涌入中国吗?

3540万印度人外流西方,西方收紧移民,会转头涌入中国吗?

错过美好
2026-08-02 21:37:25
吴奇隆成立公司,要赵丽颖出10万元,给她1%的股份。赵丽颖碍于情面,答应了,没想到后来赚了5000万

吴奇隆成立公司,要赵丽颖出10万元,给她1%的股份。赵丽颖碍于情面,答应了,没想到后来赚了5000万

互联网品牌官
2026-07-31 10:16:48
2026年,一场“有退休金也养不起老”的现实正在千万家庭上演

2026年,一场“有退休金也养不起老”的现实正在千万家庭上演

金哥说新能源车
2026-08-02 14:16:53
“实惠套餐要消失了?” 明天起,中国电信停止第三方互联网办卡!三大运营商利润正集体下滑

“实惠套餐要消失了?” 明天起,中国电信停止第三方互联网办卡!三大运营商利润正集体下滑

新浪财经
2026-07-31 18:28:04
新冠再次爆发,可能不发烧!医生:出现7个症状,别犹豫赶紧就医

新冠再次爆发,可能不发烧!医生:出现7个症状,别犹豫赶紧就医

坠入二次元的海洋
2026-07-18 12:44:04
特朗普刚放狠话,六架F35被炸,伊朗搬出中国这张牌,性质全变了

特朗普刚放狠话,六架F35被炸,伊朗搬出中国这张牌,性质全变了

混沌录
2026-08-01 17:11:06
2026-08-02 22:15:00
盒饭财经 incentive-icons
盒饭财经
约会最好的商业思想
1341文章数 16893关注度
往期回顾 全部

科技要闻

零跑月销10万破纪录!比亚迪奇瑞海外卖爆

头条要闻

女子花10万请明星带货仅卖1单 3公司"坑位费"收2600万

头条要闻

女子花10万请明星带货仅卖1单 3公司"坑位费"收2600万

体育要闻

常规赛MVP可以衡量常规赛成就吗?

娱乐要闻

徐克和多位港星送别施南生

财经要闻

长鑫科技四万亿市值背后的资本与周期

汽车要闻

历史性里程碑时刻 零跑7月交付达101267台

态度原创

游戏
艺术
健康
时尚
房产

粉丝虚幻5版《魔兽世界》定档8月15日!集显都能玩

艺术要闻

自然与艺术|奥杜邦《美洲鸟类》

中风易复发!谈中风康复与二级预防

东野宇宙,未完待续

房产要闻

1700亿砸下!信息量巨大!海南甩出又一个超级规划!

无障碍浏览 进入关怀版