网易首页 > 网易号 > 正文 申请入驻

Kimi K3最值得看的,不是参数,而是它怎样把AI训练成“办事的人”

0
分享至

No.0347

Science Partner

Bring you to the side of


导 读

最近,Kimi K3发布,最容易传播的当然是那个大数字:总参数达到2.8万亿。

但只盯着参数,就像判断一家企业强不强,不能只盯着它有多少员工。真正决定企业战斗力的,是这些人怎么分工、怎么协作,干完以后又如何验收。

清华大学公共管理学院长聘副教授陈天昊近日在朋友圈分享了自己阅读Kimi K3技术报告强化学习部分后的五点观察:九个专家模型参与后训练、智能体自动扩展知识图谱、统一的白盒智能体环境、可暂停和分叉的沙箱,以及依据任务实际完成程度给予奖励。

这五点看似都是工程细节,连在一起却说明了一件更大的事:过去的大模型,主要在学习怎样把话说对,下一代人工智能,开始学习怎样把事情做成。

走,跟伙伴君来!


今日主笔|晶恒

Kimi K3最值得看的,不是参数,而是它怎样把AI训练成“办事的人”

一、从先培养九个老师傅,再教出一个全能徒弟


现实中的工作千差万别。

回答一道知识题,和调查一个行业不是一回事。写一小段代码,和维护一个大型软件项目也不是一回事。即使是同一道题,有时只需迅速判断,有时却需要反复搜索、推理和验证。


K3没有一开始就要求一个模型什么都会,而是先训练了九个专家模型。

研发团队把任务分成三个领域,每个领域又设置三种不同的思考投入程度,形成“三乘三”的专家组合。可以把它理解为先找来九位老师傅:有人擅长知识推理,有人擅长使用工具,有人擅长写代码;同一领域里,又有人负责普通任务,有人专攻疑难杂症。

接下来,再让这些老师傅共同训练一个统一模型。

它采用的办法叫“多教师在策略蒸馏”。这个名字很复杂,道理却不难:不是老师直接把标准答案递给学生,而是先让学生自己做,老师再沿着学生已经走出的路线,对每一步作出评价。

过去不少强化学习更像期末考试。学生交卷后,只得到一个总分。考了六十分,他知道自己没学好,却不知道究竟错在第三题,还是最后一道大题。

K3则更像老师傅站在徒弟旁边,看着他操作:不但知道那道题对哪道题错,还能告诉学生这一步方向对了,下一步走偏了,这里虽然绕远,但还能救回来。

反馈从“最后打一个分”,变成“过程中的连续纠偏”。模型学到的也不只是答案,而是解决问题的方法。

二、AI现在缺的,可能不是更多资料,而是更多好题

我们过去总觉得,训练大模型就是不断给它“喂数据”。

文章越多、代码越多、图片越多,模型自然越聪明。这个逻辑在预训练阶段没有错,但进入智能体时代以后,问题变了。

一个人看过一万本管理学著作,不等于他会经营一家企业;背过所有法律条文,也不等于他能独立处理一宗复杂案件。

知识和办事能力之间,还隔着大量真实任务。

K3为此引入了一个可以持续扩展的知识图谱。它的主要用途,不是简单给模型增加一本百科全书,而是自动寻找新知识、组合新概念,进而生成新的训练任务。

比如,系统从计算机科学、物理、生物医学等大领域出发,不断向下寻找更具体的概念,再检索论文、专业文章和代码资料,把不同知识点组合起来,形成需要搜索、分析、编程或调用工具才能完成的题目。

这有点像一座自动运转的出题工厂。

传统题库的问题是,模型练得越多,越容易记住套路。题目看似不同,骨架可能完全一样。结果就是考试成绩很高,一遇到现实中的陌生问题便无从下手。

能够自动探索和更新的知识图谱,则可以不断把模型推向它没见过的角落。

这也意味着,以 K3 为标志,未来人工智能企业的重要资产,不只是拥有多少数据,还包括能不能持续生产高质量任务。毕竟,书架上有多少书是一回事,能不能设计出真正锻炼人的工作,又是另一回事。

三、不能只会开一种车,也不能只会用一种智能体

大模型和智能体经常被混为一谈,其实不是同一个东西。

大模型更像司机,智能体框架则是一整辆车。除了司机,还包括方向盘、导航、仪表盘、工具箱、记忆系统和交通规则。

同一个模型放进不同的智能体框架,表现可能差别很大。有的框架善于管理文件,有的擅长调用搜索,有的可以调动多个子智能体共同工作,还有的会自动整理和压缩长时间积累的信息。

如果模型始终在同一种框架中训练,就像一个人只会开某一款车,只要按钮换个位置,操作逻辑稍微变化,立刻生疏甚至就不会了。

K3因此搭建了一套“白盒”环境,把智能体拆成提示词、工具、记忆、技能、上下文管理等模块,再用不同方式重新组合。

模型在训练中不能只背下一套固定流程,而要学会观察:我现在拥有什么工具,工具之间是什么关系,这项任务应该如何安排,原来的计划失败以后又该怎样调整。

这比单纯让模型多答几道题困难得多,却更接近真实工作。

因为现实中真正有能力的人,不是只会使用一个软件、遵循一套表格,而是换了平台、换了团队、换了流程之后,仍然能找到完成任务的办法。

四、想让AI大胆试错,先给它造一座虚拟城市

智能体要学会办事,就必须真正操作电脑。

它要打开文件、运行程序、安装工具、修改代码,也可能做出研究人员没有预料到的操作。能力越强,尝试越复杂,出错时造成的破坏也可能越大。

所以,不能让它直接在真实系统里随便折腾。

K3使用的AgentENV,可以理解为一座为人工智能准备的虚拟城市。里面有操作系统、有软件、有文件,也有接近真实工作的任务环境。模型可以在里面试错,但这些操作尽量不会影响外部系统。

这个环境有三个很实用的功能。

一是暂停。模型进入长时间思考时,环境可以先停住,等它想好下一步再恢复,不必让整套机器一直空转。

二是分叉。任务进行到某个节点,系统可以复制出一个完全相同的现场。评估程序在副本里检查文件、运行测试,不会破坏模型原来的工作进程。

三是快照。做到关键步骤时先存档,后面失败了,可以退回原处,而不用从第一步重新开始。

听起来很像打游戏,但对智能体训练非常重要。

人类学习一项复杂技能,也需要练习场、模拟器和复盘机制。飞行员不能第一次驾驶飞机就直接载客,外科医生也不能只看完教材便独立上手。

人工智能同样如此。既要让它充分探索,又不能让一次错误变成真实事故。安全不再是模型训练完成后临时加上的围栏,而是训练系统本身的一部分。

五、别听AI说“我完成了”,直接去检查现场

K3最值得注意的一点,是它开始改变奖励标准。

过去评价大模型,往往看答案是否正确、文字是否流畅。可一旦模型开始执行复杂任务,只看它最后说了什么,就很容易出问题。

因为大模型最擅长的,恰恰是把话说得像真的一样。

它可能告诉你:“邮件已经发送,文件已经整理,程序已经修复。”但这些表述本身,并不能证明任务真的完成。

K3在部分智能体训练任务中,更重视对最终环境状态的检查。

模型说邮件发了,就查看发件箱里有没有;说代码修好了,就重新运行测试;说材料整理完了,就检查文件是否存在、内容是否完整、格式是否符合要求。

奖励来自事情究竟完成到了什么程度,而不是模型对自己工作的描述。

这一步很重要,因为它区分了两个完全不同的能力:一个是“能够解释自己做了什么”,另一个是“确实把事情做成了”。

过去的大模型更像考场里的高材生。你出题,它作答,答案写完,任务也就结束了。

未来的智能体更像刚进入公司的年轻员工。它要查资料、操作系统、调用工具、处理突发情况,最后交付一个能够被别人检查的结果。培养这样的人工智能,光给它更多书是不够的。它还需要老师傅、练习任务、工作工具、安全沙箱和一套不听汇报、只看结果的验收制度。

综上,Kimi K3真正值得关注的,并不是它装下了多少参数,而是它展示了 AI一种新的训练思路:不再满足于让人工智能显得聪明,而是开始要求它对任务结果负责。







再次诚挚致谢陈天昊教授。

我是晶恒,咱们下期见~

本文仅作科普分享使用,欢迎小伙伴们点、收藏、关注,以备不时之需,当然更欢迎您把 介绍给周边可能需要的更多伙伴们呀。


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
湖南经济为什么掉队了?当地县中医药主任轻飘飘的一句话,让人寒毛倒竖

湖南经济为什么掉队了?当地县中医药主任轻飘飘的一句话,让人寒毛倒竖

回旋镖
2026-09-07 12:45:44
一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

怪味历史连连看
2026-09-08 01:55:32
20.99万起的小米澎程?今晚有人要睡不着觉了。

20.99万起的小米澎程?今晚有人要睡不着觉了。

差评XPIN
2026-09-08 01:02:44
伟大的2-0爆冷!郑钦文一战创历史,赢麻了:排名飙升+狂揽523万

伟大的2-0爆冷!郑钦文一战创历史,赢麻了:排名飙升+狂揽523万

大秦壁虎白话体育
2026-09-08 02:24:44
世界杯-中国女篮20分大胜意大利锁D组第二 韩旭19+10杨舒予15分

世界杯-中国女篮20分大胜意大利锁D组第二 韩旭19+10杨舒予15分

醉卧浮生
2026-09-08 04:22:03
魏德尔没料到,极右翼胜选第2天,中方突然表态了,德国收到信号

魏德尔没料到,极右翼胜选第2天,中方突然表态了,德国收到信号

影孖看世界
2026-09-07 22:31:58
郑钦文,奇迹只发生在相信奇迹的人身上

郑钦文,奇迹只发生在相信奇迹的人身上

卡门的杂货铺
2026-09-08 08:03:26
在暴跌25%的市场里,雷军开始“崩老头”?

在暴跌25%的市场里,雷军开始“崩老头”?

虎嗅APP
2026-09-08 07:14:28
往长江倒黑泥后续!多部门介入,来源搞清了,网友:罚到倾家荡产

往长江倒黑泥后续!多部门介入,来源搞清了,网友:罚到倾家荡产

青梅侃史啊
2026-09-07 22:00:53
上海男子飞美国航班上挥拳打人,落地被捕次日凌晨全家遭遣返,一拳打没了全家美国签证

上海男子飞美国航班上挥拳打人,落地被捕次日凌晨全家遭遣返,一拳打没了全家美国签证

Mr王的饭后茶
2026-09-07 20:07:14
为啥女生很少有臭脚的?网友:脚臭基本上是闷出来的,试试光脚出门

为啥女生很少有臭脚的?网友:脚臭基本上是闷出来的,试试光脚出门

带你感受人间冷暖
2026-09-08 00:05:28
皇马内讧危机!伯纳乌头号巨星硬刚穆里尼奥!狂人镇不住了

皇马内讧危机!伯纳乌头号巨星硬刚穆里尼奥!狂人镇不住了

奶盖熊本熊
2026-09-08 07:46:52
美媒盯了半天还是看不懂!中国这架大飞机,怎么长得这么怪?

美媒盯了半天还是看不懂!中国这架大飞机,怎么长得这么怪?

健身狂人
2026-09-07 09:15:11
吴彦祖谈CHINA GT赛车起火事故,指责赛会方不承认错误:36小时后发出的声明是可耻的;组委会道歉后车队再发声称“回应缺乏担当”

吴彦祖谈CHINA GT赛车起火事故,指责赛会方不承认错误:36小时后发出的声明是可耻的;组委会道歉后车队再发声称“回应缺乏担当”

大风新闻
2026-09-07 16:10:19
iPhone 18系列定价曝光:标准版5999元起,Pro版9999元起,Pro Max版10999元起

iPhone 18系列定价曝光:标准版5999元起,Pro版9999元起,Pro Max版10999元起

鲁中晨报
2026-09-06 15:47:03
极右翼德国选择党选举胜利,默茨回应:深感震惊,没想到会这样,德国需要根本性改革

极右翼德国选择党选举胜利,默茨回应:深感震惊,没想到会这样,德国需要根本性改革

环球网资讯
2026-09-07 21:24:44
官宣!17岁吕孟洋加盟西班牙人 走武磊之路 董路:不保证踢上西甲

官宣!17岁吕孟洋加盟西班牙人 走武磊之路 董路:不保证踢上西甲

念洲
2026-09-08 07:34:48
郭德纲歪曲篡改抗战歌曲,武汉市文旅局处理通报

郭德纲歪曲篡改抗战歌曲,武汉市文旅局处理通报

天涯社区
2026-09-08 07:05:35
特朗普真的去世了?9月4日,社交平台上又一次传出"特朗普已经死亡、白宫隐瞒消息"的说法!

特朗普真的去世了?9月4日,社交平台上又一次传出"特朗普已经死亡、白宫隐瞒消息"的说法!

扶苏聊历史
2026-09-07 17:39:23
CCTV5直播,中国女篮VS波多黎各队,惊险躲开澳大利亚,冲击八强

CCTV5直播,中国女篮VS波多黎各队,惊险躲开澳大利亚,冲击八强

体坛小快灵
2026-09-08 09:55:54
2026-09-08 11:31:00
科学伙伴 incentive-icons
科学伙伴
把科学用通俗易懂的方式带到您身边
292文章数 58关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

媒体:日本先把战犯神社、镇魂妖塔拆了 再谈"伤感情"

头条要闻

媒体:日本先把战犯神社、镇魂妖塔拆了 再谈"伤感情"

体育要闻

郑钦文,奇迹只发生在相信奇迹的人身上

娱乐要闻

郭德纲乱改抗战歌曲被重罚!

财经要闻

全球黄金“回家”

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

游戏
家居
教育
时尚
本地

《GTA6》过于真实引发争议 R星正在努力找平衡

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

唐浩睿:快乐栖居!上海,孩子的快乐乡

白露食白——露从今夜白,味从此时鲜

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

无障碍浏览 进入关怀版