网易首页 > 网易号 > 正文 申请入驻

一百万Token之外,Kimi K3开始学习“暂停”

0
分享至


让Agent停下来,再接着做

作者 | 许有阳

来源 | 盒饭财经(ID:daxiongfan)

头图及封面来源 | codex

月之暗面兑现了11天前留下的欠条。

7月16日,月之暗面发布Kimi K3时,模型已经进入Kimi.com、Kimi Work、Kimi Code和API。当时,其官方表示,完整模型权重不晚于2026年7月27日落地。

上周,盒饭财经在一文中,讨论了长线程为什么正在成为前沿模型的新战场。而这是月之暗面第一次系统披露,K3面向超长Agent任务的训练和运行机制。

27日晚,在DDL前,月之暗面踩点正式开放权重。这一次,完整模型权重正式上线Hugging Face,47页技术报告、模型配置与Kimi K3 License也同步出现在GitHub模型仓库中。另外,MoonEP与AgentENV也随之开放,4月已经开源的FlashKDA也被纳入完整技术栈。


然而,在这次公开的内容中,最能解释K3的数字,并不是最显眼的参数量和上下文窗口。

技术报告称,训练与评测期间一共创建了51,219,741个沙箱,涉及1,505,678种镜像。同时,沙箱可能将高达98%的生命周期花在等待模型推理,月之暗面因此让它暂停时释放CPU和内存,再在最低49毫秒内恢复。

什么意思?

训练一个能使用工具的Agent,不只是让模型在GPU里生成答案。每当Agent需要安装软件、修改文件或者运行测试,系统都要为它准备一台相互隔离的“临时电脑”。技术报告中的“沙箱”,就是这样的工作环境;而“镜像”则相当于预装了不同操作系统和软件组合的环境模板。

5122万个沙箱是K3训练和评测期间累计创建的工作环境。150多万个镜像,也从侧面反映出这些任务涉及的软件环境和依赖组合极为多样。

于是,问题来了,沙箱最高有98%的时间是在等待模型给出下一步指令,如果这些环境一直开着,就会持续占用CPU和内存。AgentENV的办法是把等待中的环境暂时冻结并释放资源,等模型返回后,再恢复原来的文件、内存和运行状态。月之暗面官方公布的最低恢复时间为49毫秒。

换句话说,K3处理的不只是“模型能思考多久”,还有模型暂停思考时,那间已经工作了一半的“办公室”能不能先关灯,醒来后又保持原样。

这指向了Agent时代的新问题。

上下文窗口解决的是,模型一次能带着多少资料工作,而长线程解决的是,这项工作怎样不断线。这些意味着,任务运行十几个小时后,模型还要记得最初目标;意味着等待测试或人工审批时,系统不能一直占着算力;还意味着,机器或网络中断后,已经修改的文件和正在运行的进程也不能消失。

100万Token,也只是把“桌面”变大。

100万Token,仍然装不下一项工作

从7月16日的产品发布到7月27日的正式开放,K3补齐了一条从模型到基础设施的链条。


这里需要先区分“开放权重”和“完整开源”分别意味着什么。K3官方将其定义为开放权重模型:外部开发者可以下载和部署模型,但训练数据、奖励模型和完整训练流水线并未全部公开。

开放权重意味着外部开发者可以下载训练完成的模型,自己部署或继续微调。但,它不代表训练数据、奖励系统和全部训练代码都已公开。

根据Kimi K3 License,许可证设置了两类商业条件。对于符合定义的MaaS经营者,如果关联主体连续12个月合计收入超过2000万美元,需要另行取得商业协议;如果搭载K3的商业产品月活超过1亿,或月收入超过2000万美元,则需要在产品中显著展示“Kimi K3”。

MoonEP、FlashKDA和AgentENV则采用限制更少的MIT许可证,社区可以较自由地使用和修改这些基础设施。

据了解,MoonEP、FlashKDA和AgentENV对应的是K3运行链条上的不同环节。MoonEP处理MoE训练中的专家并行通信与负载均衡,FlashKDA提供Kimi Delta Attention的高性能计算算子,AgentENV则负责创建、隔离和恢复Agent使用的沙箱。

换句话说,月之暗面这次公开的不只是“大脑”,还包括让它训练、计算和工作的部分基础设施。

也就是说,K3完成了开放权重,并把相当一部分关键基础设施送进开源生态。权重落地后,外界可以进一步核验模型文件、架构配置,并尝试独立部署和复现。

K3共有2.78万亿参数,但每次处理一个Token时只调用其中约1042亿参数。同时,它拥有1,048,576 Token上下文,并从训练早期就同时学习文本与视觉信息。

这100万Token也不是在训练最后把上下文窗口直接拧到最大。

K3先在8K、64K等较短文本上训练,进入后期后再从256K扩到1M。而月之暗面还合成了一批需要在百万Token中寻找分散线索的任务。技术报告同时提醒,窗口变长不等于模型自然学会处理长任务。


K3首发时展示的芯片设计任务,提供了一个更直观的时间刻度。一个早期版本在一次48小时自主运行中,使用开源EDA工具和Nangate 45nm工艺库,完成并仿真验证了一套用于其自身架构微型模型的芯片设计。

这并不意味着模型连续生成了48小时文本。技术报告确认,它在Kimi Code中使用EDA工具,依次完成设计、优化和验证;从系统结构看,整个过程由模型推理、工具执行和结果回传交替组成。一条任务就这样在模型、工具和环境之间持续了两个昼夜。

这也是100万Token解决不了全部问题的原因。

窗口可以保存模型看过的信息,却不会自动保存正在运行的测试、已经安装的依赖和被修改的文件。参数决定模型有多大,窗口决定它一次能看见多少,而那5122万个沙箱提出的是另一个问题:任务停下之后,现场还在不在?

同一项工作,四种“接着做”

晚上十点,你把代码仓库和问题单交给一个编程Agent。它先阅读文件、安装依赖并复现问题,随后修改代码、运行测试。第一次测试失败后,它继续读取日志,准备第二轮修改。

如果任务半小时内结束,这些动作或许都能留在同一轮对话里。但时间继续向后走,新的问题会依次出现:凌晨一点,上下文即将写满;凌晨两点,Agent改坏了代码;凌晨三点,运行节点突然故障;第二天上午,流程又停在等待人工批准的步骤。

这时需要保存的,已经不只是聊天记录。


面对这个问题,OpenAI的解题思路是,首先处理上下文写满的问题。

GPT-5.1-Codex-Max接近窗口上限时,会启动一种名为“上下文压缩”的机制。在这套机制中,系统整理此前的交互,留下它判断重要的内容,再把这份精简历史交给一个新窗口。

于是,可能就会出现这样的情况。当你凌晨一点上下文用尽时,Agent不必结束任务,它可以带着整理后的进度继续读代码、调用工具。OpenAI称,这是公司第一个被原生训练来跨多个上下文窗口工作的模型,内部评估中观察到过超过24小时的任务。

这条路线解决了“对话装不下”。但它的代价也发生在整理过程里:压缩并非随机删除,但系统必须判断什么重要。从目前公开机制看,被保留和被舍弃的内容主要由系统判断。对用户来说,压缩提高了任务长度,却也带来一个难以直接检查的问题:系统究竟忘掉了什么?

Anthropic的思路是,先解决Agent改错代码怎么办?

Claude Code会在Claude每次修改代码前自动保存一个“检查点”,也就是当时的代码版本和对话位置。如果Agent凌晨两点改坏了支付逻辑,用户可以回到凌晨一点半的代码状态,也可以同时恢复当时的对话,再从另一个方向尝试。

但这个“撤销键”只覆盖Claude的编辑,不覆盖用户自己修改的文件,也不覆盖模型通过终端命令造成的变化。也因此,Anthropic仍建议配合Git等版本控制工具。

代码回到了正确版本,不代表整个任务现场都回来了。安装到一半的依赖、终端里运行的服务和外部工具已经产生的副作用,仍需其他系统处理。

Google处理的则是进程和连接随时可能中断的问题。

快照的概念早就有了。早在1985年,Mani Chandy与Leslie Lamport就提出了分布式快照,研究如何在一套系统继续运行时,记录各个组件处于什么状态。

Google Agent Executor使用事件日志和快照保存可恢复状态。节点故障后,系统可以恢复未完成的任务;客户端断线重连时,也能根据最后收到的序号补回遗漏事件。

打个比方,凌晨三点,运行这个Agent的节点突然故障。借助事件日志和快照,系统可以恢复未完成的执行;如果只是用户电脑断网,客户端重新连接后,还能从上次收到结果的位置补回遗漏事件。

为了避免两个执行器同时更新文件或会话、把状态改乱,同一会话在同一时刻只允许一个执行器写入。Google把这项规则称为“单写入者”(single-writer)机制。

这让任务不会因为机器或网络故障消失,却没有让模型本身更会记忆,也不会替模型发现目标已经漂移。Google保存的是“发生过什么”,而不是训练模型如何跨过一次中断。

微软面对的,则是一项工作本来就需要停下来。

打个比方。

在报销、采购或跨部门流程中,Agent做到某一步后可能要等经理批准。结果或许几分钟后到,也可能几天后才到。Durable Agents会把对话、流程步骤、审批状态和计时器写入长期存储,等待期间释放计算资源。等到批准到达后,系统从下一步继续,这就不用让模型几天不关机。

它可以等待数小时、数天甚至数周,但保存每个会话的记录并不是无限大。微软文档同时提示,在Durable Task Scheduler后端中,单个Agent会话对应的持久化实体状态存在1MB容量上限。随着对话和步骤不断增长,开发者仍需主动压缩或开启新会话。


至此,同一问题的四种不同解法真正显现:OpenAI让对话跨过窗口,Claude让代码跨过错误,Google让运行过程跨过故障,微软让业务流程跨过等待。它们都在帮助Agent“回来”,只是分别保留了不同部分。

当然,多Agent也不能代替这些状态。把任务拆给几个Agent可以提高速度,但协调者仍要知道每个Agent改过什么、文件是否冲突,以及失败后从哪里恢复。并行解决的是同时做,检查点解决的是接着做。

前述四条路线主要回答Agent在实际运行时怎样不断线,其中OpenAI还把跨窗口压缩纳入模型训练。K3的增量则落在Agent强化学习:如果一条工具调用轨迹长到跨过一次训练迭代,未完成的部分是丢掉,还是带着模型缓存和沙箱状态进入下一轮?


“暂停”任务,月之暗面押注工作流

我们把刚才那项“跨夜改代码”场景假设的任务,放大到K3的训练集群里。

现在面对的,是一批任务同时生成多条执行记录。在强化学习中,模型从接到任务、采取行动到获得结果的完整过程,被称为一条“轨迹”;系统根据任务是否完成、结果是否正确,为轨迹计算分数,再用这些结果更新模型。

不同轨迹需要的时间并不相同。有的任务几分钟就完成,有的仍在搜索资料,有的正在编译代码,还有的反复修改后仍未通过测试。

传统同步流程中,本轮轨迹生成通常要等整批结果结束,才能整体进入后续的策略优化。只要最后几条轨迹仍未完成,整个训练流程就可能被长尾拖住。

K3改变了这个顺序。

当完成轨迹达到预设比例后,训练系统就暂停剩余的长尾轨迹,让后续优化先向前推进。被暂停的轨迹不会被判定失败,它会进入队列,在下一轮优先恢复。 月之暗面把这套机制称为partial rollout,即“部分轨迹生成”。

严格来说,决定暂停的是训练调度器。所谓K3“学会暂停”,不是模型主动休息,而是训练系统保留未完成轨迹,随后让模型在原有状态上继续生成。

问题随之而来:一条任务到底要保存什么,才能真正回来?

假设被暂停的Agent已经读过大量代码,安装了依赖,修改了三个文件,测试进程仍在运行。此时只保存聊天摘要,Agent知道自己要修Bug,却会回到一台没有依赖、没有改动的干净机器。如果只保存虚拟机,文件和进程都在,模型却未必记得为什么这样修改。如果只保存全部文字,恢复时又要重新处理几十万甚至上百万Token的历史。

结合K3技术报告和模型卡,可以把它为了“暂停后续跑”所保留的状态,大致归纳为三类。

第一类是任务记录。多轮对话和工具调用时,Agent框架需要把模型此前返回的完整消息再次传回,包括接口此前返回的推理内容和工具调用记录。最先要接上的是任务历史:目标是什么,工具做过什么,模型为什么修改这些文件。

第二类是已经算过的中间结果。模型处理长上下文时,会缓存前文的计算结果,避免生成每个新Token时都从头阅读。文字历史之外,K3还保留已经算过的模型缓存。否则,上百万Token需要重新计算。

第三类是实际工作环境。普通软件容器里的多个任务通常共享宿主机内核。如果Agent执行危险命令,一个任务可能影响整台机器。AgentENV因此没有只用普通容器,而是选择一种更轻量、同时能为每个沙箱提供独立内核的微型虚拟机。

从整个系统看,要让一条轨迹在下一轮继续,训练系统需要接上此前的任务历史,复用仍然有效的模型缓存,并在再次调用工具时恢复相应的微型虚拟机环境。此前安装的依赖、修改的文件和等待中的测试进程状态仍被保留,Agent可以从中断处继续。

等待模型时,系统先记录沙箱的内存和文件变化,再释放CPU和内存;新指令到达后,系统恢复微型虚拟机。此前安装的依赖、修改的文件和测试进程可以从保存下来的状态恢复。发生错误时还可以回到此前快照,需要验证结果时则可以从当前状态复制一个独立环境。

这才是K3所说的“暂停”。

这条路线并非突然出现,它与杨植麟长期关注的长序列问题存在一条清晰的研究脉络。三项工作处理的边界并不相同:Transformer-XL面对文本片段的边界,Kimi k1.5面对输出预算和训练迭代的边界,K3面对的则是长时间Agent轨迹及其运行环境。它们的共同点是,越过边界时尽量不要从头开始。

2019年,杨植麟、戴梓航等人提交Transformer-XL论文。它处理的是阅读边界:模型读完一段文字后,不把此前计算出的内部状态全部清空,而是带着它继续理解下一段。2025年1月,Kimi k1.5把“保留未完成部分”带进强化学习:一条尚未生成完的长回答,可以留下已经完成的内容,下一轮从断点接着生成。

过去,月之暗面试图让模型读完更长的文本,现在,它尝试让模型做完更长的工作。

开放权重之后

这也解释了7月27日正式开放的另一层价值。

7月17日,也就是K3发布的第二天、完整权重尚未落地时,Arena联合创始人兼CEO Anastasios Angelopoulos对媒体称,这“可能是今年最大的一次发布”。而杨植麟在卡内基梅隆大学的导师、曾任苹果AI研究主管的Ruslan Salakhutdinov则把它称为开放模型社区的一次巨大胜利。

当时,外界能够直接观察的主要还是在线产品、API价格和榜单表现。如今权重真正公开,讨论才从“它表现怎样”进入“别人能否运行和改造它”。

K3正式开放,让外界第一次能把模型能力、基础设施与许可证放在一起判断。这一系列的事件,回看后不难发现,月之暗面的技术取向也逐渐清晰:同时保存训练轨迹、模型计算状态和运行现场。

大模型时代争的是一次能读多少。而Agent时代争的或许是,停下来之后,谁还能回到原来的工作里。

参考资料:

1.《月之暗面Kimi K3正式开源》,界面新闻

2.《Kimi K3: Open Frontier Intelligence》,Kimi官方

3.K3模型仓库,https://github.com/MoonshotAI/Kimi-K3

4.K3技术报告,https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf

5.《Distributed Snapshots: Determining Global States of Distributed Systems》,

6.K3 Hugging Face权重页,https://huggingface.co/moonshotai/Kimi-K3

7.K3模型卡,https://github.com/MoonshotAI/Kimi-K3/blob/main/README.md

8.《Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context》

9.《Transformer-XL: Unleashing the Potential of Attention Models》,Google官方

10.Kimi k1.5论文与仓库,https://github.com/MoonshotAI/Kimi-k1.5

11.《Introducing Agent Executor, Google’s distributed Agent Runtime》,谷歌官方

12.《构建更多可能:GPT‑5.1‑Codex‑Max 简介》,OpenAI官方

13.《Enabling Claude Code to work more autonomously》,Anthropic官方

14.《Kimi K3 Is Here: Efficient Day-0 Support on vLLM》,vLLM官方

15.《Durable Task extension for Microsoft Agent Framework》,Microsoft官方

16.Kimi K3 License、MoonEP与FlashKDA,MoonshotAI GitHub

17.AgentENV,kvcache-ai GitHub;K3技术报告称其由团队与合作伙伴共同开发

欢迎在评论区留言~如需开白请加微信:YPYP01234567

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中国潜水者印尼猎杀玳瑁拍视频,48小时内被捕,将面临什么处罚?

中国潜水者印尼猎杀玳瑁拍视频,48小时内被捕,将面临什么处罚?

据说说娱乐
2026-09-16 10:11:00
62岁大妈出轨被抓,丈夫没打也没骂,只平静地提出了一个条件,大妈听完后,当场跪在地上求他:我真的办不到啊

62岁大妈出轨被抓,丈夫没打也没骂,只平静地提出了一个条件,大妈听完后,当场跪在地上求他:我真的办不到啊

百晓史
2026-08-15 09:03:27
注意!武汉已全面取缔共享电动车

注意!武汉已全面取缔共享电动车

娱乐的硬糖吖
2026-09-16 13:49:24
王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

人类的关注
2026-09-06 04:32:21
快来了!中国第三条南北大通道,直接打穿山河三省 | 地球知识局

快来了!中国第三条南北大通道,直接打穿山河三省 | 地球知识局

地球知识局
2026-09-16 10:45:44
一”字涨停、炸板、再涨停!002912,“4连板

一”字涨停、炸板、再涨停!002912,“4连板

新浪财经
2026-09-16 12:33:21
93岁原卫生部副部长曹泽毅:我从不养生,只做7件事,比补品管用

93岁原卫生部副部长曹泽毅:我从不养生,只做7件事,比补品管用

小方说跑步
2026-08-22 09:10:06
“已经吃过一次亏”,周鸿祎称不会再投资新能源车,他曾19亿元投资哪吒汽车,还喊话哪吒汽车CEO要学习雷军

“已经吃过一次亏”,周鸿祎称不会再投资新能源车,他曾19亿元投资哪吒汽车,还喊话哪吒汽车CEO要学习雷军

时间财经
2026-09-16 15:27:46
日本全面叫停种植牙?种牙潜藏的风险与后遗症,一次为你讲明白

日本全面叫停种植牙?种牙潜藏的风险与后遗症,一次为你讲明白

健康科普365
2026-08-13 14:30:15
阿根廷之所以大老远把牛肉便宜卖到中国,是因为中国什么部位都要

阿根廷之所以大老远把牛肉便宜卖到中国,是因为中国什么部位都要

流苏晚晴
2026-09-15 12:17:39
深圳普工王阿姨退休了:交了 19 年社保,拿到手的养老金让人沉默

深圳普工王阿姨退休了:交了 19 年社保,拿到手的养老金让人沉默

王二哥老搞笑
2026-09-16 00:58:12
“只生一个孩子,也没见你有钱!”4个儿子的妈公开嘲笑独生子女家庭,被评论区打脸!

“只生一个孩子,也没见你有钱!”4个儿子的妈公开嘲笑独生子女家庭,被评论区打脸!

林林先生
2026-09-16 07:35:03
生育大势定了!2026新生儿预估出炉,生育率低根本不是年轻人偷懒

生育大势定了!2026新生儿预估出炉,生育率低根本不是年轻人偷懒

阿校谈史
2026-09-16 09:28:40
极客湾视频突然下架!麒麟9050 Pro测试结果总结

极客湾视频突然下架!麒麟9050 Pro测试结果总结

真义科技
2026-09-15 18:30:39
今明两天北京气温小幅回升,今秋第一场雨即将上线

今明两天北京气温小幅回升,今秋第一场雨即将上线

新京报
2026-09-16 12:28:13
2年8706万美金!2年8190万美金!快船新双巨头诞生,小卡好走不送

2年8706万美金!2年8190万美金!快船新双巨头诞生,小卡好走不送

微评体育圈
2026-09-16 11:23:57
蒙古国政府再次公开拒绝了中方提出的跨境铁路运力扩容方案

蒙古国政府再次公开拒绝了中方提出的跨境铁路运力扩容方案

果妈聊娱乐
2026-08-23 08:38:03
巴萨晴天霹雳!大巴黎强势挖角诺坎普天才!昔日核心恐被逼走人

巴萨晴天霹雳!大巴黎强势挖角诺坎普天才!昔日核心恐被逼走人

澜归序
2026-09-16 09:53:51
高速大整改真来了!不取消120限速,开车方式彻底变样

高速大整改真来了!不取消120限速,开车方式彻底变样

三农老历
2026-09-15 04:13:38
大陆还没发话,岛内先开价!热议两岸和平统一,张口甩出六大条件

大陆还没发话,岛内先开价!热议两岸和平统一,张口甩出六大条件

寻墨阁
2026-09-16 13:51:42
2026-09-16 15:56:49
盒饭财经 incentive-icons
盒饭财经
约会最好的商业思想
1349文章数 16896关注度
往期回顾 全部

科技要闻

赛力斯接管问界,撑得住华为给的身价吗?

头条要闻

8岁孩子名下多出两套房 系母亲"同居男友"为躲债过户

头条要闻

8岁孩子名下多出两套房 系母亲"同居男友"为躲债过户

体育要闻

道曼双响比肩鲁尼 阿森纳轻松晋级却有两人挨骂

娱乐要闻

郭麒麟瘦到全网认不出,为新剧塑形

财经要闻

中际旭创六家供应商股东疑现关联人

汽车要闻

方向盘踏板全取消 特斯拉Cybercab国内亮相实拍

态度原创

亲子
教育
游戏
房产
家居

亲子要闻

那些天赋异禀的小孩,这也太厉害了吧!

教育要闻

无从下手,老师都无奈了

巫师3重制版要媲美造现代新作体验 不只是简单翻新

房产要闻

海口楼市格局,即将大变!存量住宅盘,可能只剩33个!

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版