网易首页 > 网易号 > 正文 申请入驻

CaSKG:给AI智能体的"技能记忆"装上一套谎言探测器

0
分享至


你有没有遇到过这种情况:办公桌上堆满了工具书,你要用的时候翻半天找不到,但如果只留一本工具书在手边,又总是缺那么一页关键内容?

这其实是所有"记忆管理系统"共同面对的老问题。而现在,这个问题落到了AI智能体身上,变得更棘手了。

大语言模型智能体*:能够自主调用工具、执行多步骤任务的AI程序,比如帮你订机票、玩文字游戏、甚至操作虚拟实验室的智能助手。

这些智能体越来越聪明,也越来越"健忘"。为了让它们不必每次都从零学起,研究者们给它们配备了技能库,把之前做成功的操作流程存起来,下次遇到类似任务直接调用。听起来很美好,但技能库越攒越大之后,一个新问题冒了出来:这么多技能,AI到底该从哪儿开始翻?

**这就是这篇论文要解决的核心矛盾:如何在数千条技能记录里,精准地找到那几条真正有用的,而不是把整个仓库倒给AI,也不是随便捞几个看起来沾边的。**

这事儿难在哪儿

先说说业内目前的三种做法,以及它们各自的坑。

第一种做法简单粗暴:全部展示。把整个技能库塞进AI的上下文窗口里,让AI自己挑。这样做的好处是不会漏掉任何有用的技能,但代价也很直白,AI要在几百上千条技能描述里做选择题,选择的负担全压在了它自己身上,还容易被无关选项带偏。

第二种做法是向量检索*:把每条技能的文字描述转换成一串数字(向量),通过计算这些数字之间的相似度来判断哪些技能和当前任务"长得像"。

这种方法能大幅压缩返回的技能数量,但它有个致命缺陷:它把每条技能当成孤立的文本单元来看待。可现实中的任务往往不是靠一条技能就能搞定的,你得先准备材料,再执行操作,最后还要检查结果对不对。这些互相依赖的技能,光靠"文字长得像不像"是判断不出来的。论文里提到一个很扎心的研究结论:文本检索得分本身,根本不能可靠地预测一个工具是否真的对当前任务有用。

第三种做法更进一步,叫图检索。既然技能之间有依赖关系,那就把这些关系画成一张图,节点是技能,边是它们之间的联系,检索时不光看文本相似度,还沿着图上的边把相关的技能也"捎带"出来。这里绕不开一个已有的工作,叫做Graph-of-Skills(简称GoS),它构建了一张技能依赖图,让工作流相关的技能能够进入检索结果,这确实解决了纯向量检索的一个大问题。

但图检索也有自己的麻烦。

**问题出在"边"上:一条边如果建立在表面的相似或者巧合的共现基础上,看起来煞有介事,实际上根本经不起推敲,一旦这种不靠谱的边参与到关联度的传播计算里,就会把不相关的技能也带进最终结果,污染整个检索质量。**

这就好比你在一个陌生城市问路,路人甲说"往前走能到火车站",路人乙说"往左拐能到火车站",你不知道谁说的靠谱,如果两条路都信,最后可能走进死胡同。图检索面临的正是类似的困境:候选关系摆在那儿一大堆,但到底哪些值得信任?

论文作者把这个问题提炼成了一句话:这不是要不要建更大的图的问题,而是一个预算有限条件下的边置信度校准问题。给定一堆看起来靠谱的候选关系,系统必须决定哪些边值得花力气去验证,验证后该给多少信任分,这份信任分又该如何控制关联度在图上的传播强度。

CaSKG的核心设计:先海选,再"逼供"

论文提出的方法叫CaSKG,全称是反事实因果技能图。

反事实推理*:一种"假如当初不这样,结果会怎样"的推理方式,比如假设去掉某个条件,看看事情是否还成立。

它的整体思路可以概括成四个步骤:先广撒网找候选关系,再挑一部分候选关系做"审讯",根据审讯结果给每条边打分归类,最后基于这张打磨过的图做检索。这四步分别对应候选图归纳、反事实边探测、边状态发布、任务导向检索。

我们一步步拆开看。

第一步:候选技能图归纳,先把网撒大

这一步的目标很简单,就是尽可能多地把"可能有关系"的技能对找出来,不追求精确,追求的是不漏掉。

具体来说,CaSKG综合了多种信号来判断两个技能之间是否可能存在关系:词面上的相似(描述用词接近)、语义上的相似(意思相近但用词不同)、输入输出接口是否兼容(一个技能的产出正好是另一个技能需要的原料)、以及在整体工作流中的结构位置(谁通常在谁前面,谁负责收尾)。如果有"修复证据"(一个技能能不能帮另一个技能擦屁股)或者引入大模型作为裁判进一步打分,这些信息也会被纳入考量。

这些信号会被加权平均,算出一个初始的关联分数,取值在0到1之间。特别地,如果某条边的结构信号特别强(比如它俩明摆着是工作流里紧挨着的两步),即便其他信号一般,系统也会给它兜底保留,不至于因为文字表述差异大就被漏掉。

这一步做完,会形成一个候选关系集合,论文的实验里,从1000个技能中筛出的候选关系接近一万条。

这就好比你想在一座陌生城市找靠谱的餐馆,第一步是先把大众点评上所有评分超过三星的店都列一遍,不管它是不是真好吃,先建立一个"可能不错"的名单。这个阶段的策略就是宁滥勿缺,因为漏掉的餐馆以后就再也没机会被发现了,而多列几家不好吃的,后面还有机会筛掉。

第二步:反事实边探测,把嫌疑犯拉去审问

光凭"看起来相关"是不够的,接下来CaSKG要对候选边动真格。但是全部一万条都验证一遍,成本太高,所以系统会挑出一个预算内的验证子集,对这部分候选边施加三种"审讯手段"。

第一种叫移除探测:把源技能从场景里直接抽走,看目标技能是不是废了。如果抽走之后目标技能明显不好使了,说明这个源技能对它来说是必要的,这叫必要性。

第二种叫替换探测:把源技能换成一个八竿子打不着的技能,看目标技能是不是照样受影响。如果换了之后目标技能表现下降,说明原来那个源技能不是随便什么技能都能顶替的,这叫专属性。

第三种叫重排探测:把提议中"谁在前谁在后"的顺序倒过来,看整个流程是不是还说得通。如果倒过来之后流程立刻乱套,说明这条边确实有方向性,不是可以随便颠倒的邻居关系,这叫顺序依赖。

**这三种探测手段共同回答的问题是:这条看起来相关的边,到底是真的操作上的依赖,还是仅仅因为两个技能话题相近才凑到一起的假象。**

这就像招聘面试里的背景调查。候选人简历写得天花乱坠(候选边的初始关联分很高),但你不能光看简历就录用他,你得打电话给他上一家公司核实(移除探测:如果他真离职了,上家公司业务是不是受影响),得看看换个人是不是也能干这活(替换探测:这人是不是可替代的),还得看看他的履历时间线对不对(重排探测:他说的经历顺序是不是符合逻辑)。如果跳过这些核实环节,直接按简历录用,结果往往是招进来一个金玉其外的人。

第三步:贝叶斯校准和边状态发布,给每条边定性

三种探测各自会返回一个支持度分数,CaSKG用一种叫贝叶斯平滑的统计方法把这三个分数汇总成一个综合的可信度指标。

贝叶斯平滑*:一种统计估计方法,通过给"先验假设"加权融合观测证据,避免因为数据量少而得出极端结论,让估计结果更稳健。

根据这个可信度指标,每条候选边会被打上四种标签之一:确认(这条边靠谱,全权重保留)、不确定(证据模棱两可,降权使用)、拒绝(证据明确反对,直接从图上抹掉)、未验证(没轮到它被审讯,只保留极少一部分作为兜底的骨架,权重压得很低)。

这个设计非常关键:**它不是简单的"留"或"删"二元判断,而是一个带有置信度梯度的连续过滤机制,让证据强的关系享有更大话语权,证据弱的关系影响力被主动削弱。**

想象一个新闻编辑部收到很多线人爆料。总编不能每条爆料都当头条发(那样假新闻满天飞),也不能因为核实成本高就干脆什么都不发(那样漏掉真新闻)。合理的做法是核实充分的消息大版面刊登,核实一半的消息放在角落小字提醒,明确证伪的消息直接毙掉,还没来得及核实的留一条小尾巴以防万一是真的。这正是CaSKG边状态发布机制想要模拟的编辑逻辑。

第四步:任务导向检索,让校准过的图开始干活

图建好之后,检索阶段用的是个性化PageRank*:一种网页排名算法的变体,从查询相关的"种子节点"出发,沿着图上的边扩散相关性,边越靠谱、越集中,扩散出的结果越聚焦。

给定一个任务查询,系统先用词面和语义匹配找出几个种子技能,然后让相关性沿着刚才校准好的图向外扩散,扩散过程中会不断地"折返"回种子技能附近,防止跑偏太远。最终排名靠前的技能被打包返回给下游智能体使用。

整个流程里,图的构建是离线完成的,也就是提前算好、封存起来,不会在智能体执行任务的过程中临时调整,这样做的好处是不会给在线推理增加额外的计算负担,也不会改变智能体本身的决策逻辑。

实验结果说了什么

论文在两个交互式基准测试上验证了CaSKG的效果:ALFWorld,一个模拟家庭场景任务的环境,涉及找物品、开关电器、移动物品等操作;ScienceWorld,一个模拟科学实验的环境,涉及测量、分类、化学反应观察等步骤。

实验覆盖了六种大模型底座,包括MiniMax、GLM、Kimi、Qwen、DeepSeek和GPT系列的最新版本。

| 方法 | ALFWorld成功率均值 | ScienceWorld得分均值 |

| 全库暴露 | 73.30% | 67.71 |

| 向量检索 | 74.05% | 68.20 |

| GoS(图检索基线) | 80.01% | 72.62 |

| **CaSKG** | **86.79%** | **80.50** |

(注:均值为按六个模型简单平均计算得出,用于直观展示整体趋势)

数据很直白:**CaSKG在全部十二种模型与基准的组合里都拿到了最高分,而且在所有组合中都比GoS用了更少的环境交互步数**。

这里有个细节值得多说两句。改进幅度在不同模型上并不均匀。表现较弱的MiniMax模型,在ScienceWorld上从GoS的55.85分跳到CaSKG的68.33分,提升了12.48分;而已经接近满分的GLM模型,提升幅度收窄到4.78分。这说明CaSKG最擅长的场景,是模型本身需要检索系统补充缺失的操作步骤知识时,而不是模型已经很强、自己就能搞定大部分任务的时候。

还有一个有意思的反常案例。在ALFWorld上测试GPT-5.6-Luna这个模型时,向量检索和GoS的表现反而都比什么都不做(全库暴露)还差,向量检索只有55%,GoS也只有60.71%,而全库暴露有72.86%。这说明如果图里混进了太多误导性的边,图检索有可能比不检索还糟糕。CaSKG在这个案例里拿到了75.71%,重新夺回了检索方法应有的优势。

**这个反常案例其实是全篇最有说服力的证据:它证明了图结构本身不天然带来收益,真正决定成败的是图上那些边到底靠不靠谱。**

具体案例:一次导电测试的完整对照

论文里给了一个很生动的例子。任务是判断食盐是否导电,正确流程需要五步:聚焦材料、搭建电路、观察结果、给材料分类、把它放进对应的盒子。

用CaSKG的智能体,检索到的技能包正好覆盖了导电测试、电路搭建连接、材料分类、最终放置这四个环节,24步就完成任务,拿了满分100分。

用GoS的智能体,混进了一些无关的工具类技能,智能体花了大量步骤在修复错误的连接指令上,30步用完只拿到55分。

用向量检索的智能体,检索结果几乎全是不相关的技术工具,根本没形成一个能跑通的电路方案,只拿了5分。

**这个例子直观地展示了CaSKG的优势所在:它返回的不是单独一个"导电测试"技能,而是一整条准备、操作、验证、放置的完整依赖链条。**

规模测试:库越大,优势越明显吗

论文还测试了技能库从200条扩到2000条时,CaSKG相对GoS的优势是否稳定。结果显示,在MiniMax模型上,无论库规模是200、500、1000还是2000,CaSKG始终领先GoS,领先幅度从7.14到22.86个百分点不等,在500条规模时差距最大。Qwen模型上也呈现类似规律。

这说明校准图边这件事,不是小规模玩具场景下的取巧,规模变大之后依然有效,甚至在中等规模下优势最明显,因为这时候候选关系的噪声干扰最容易积累。

拆解实验:每个部件到底贡献了多少

论文做了消融实验,把CaSKG拆开来看每个组件单独的作用。

如果只用语义相似度构建候选图(去掉词面、输入输出、结构信号),成功率从73.57%掉到67.14%,说明多信号融合确实能捞到那些"语义上不像但操作上有关联"的技能对。

如果去掉大模型裁判打分环节,成功率从73.57%降到71.43%,说明这个额外的裁判环节能进一步修正边界模糊的关系判断。

如果把所有候选边不做筛选全部发布(跳过反事实探测和状态过滤),成功率是71.43%,比完整版本低了两个百分点,同时候选边数量从最终发布的3292条暴涨到全部9937条。

**这组对比清楚地证明了一件事:图并不是越密越好,经过校准筛选后只保留三分之一左右的边,反而比全部发布效果更好。**

这就像一个人脉网络。你手机通讯录里存了两千个联系人,但真正能在关键时刻帮上忙的,可能只有两百个。如果遇到事情就把两千个人的电话全打一遍,不仅浪费时间,还可能被一堆不靠谱的建议带偏方向。真正聪明的做法是提前分辨出哪些人靠谱,关键时刻只联系那批人。

写在后面

读完这篇论文,最让我意外的一点是那个GPT-5.6-Luna的反常案例。它打破了一个我原本下意识觉得理所当然的假设:图检索天生比向量检索强,因为它多了一层关系信息。但数据摆在那里,向量检索55%,图检索反而更差只有60.71%,这说明多一层结构信息如果质量不过关,反而是负担而不是助力。这提醒我,在评价任何"加了更多信息"的系统时,不能只看信息量的增加,还得追问这些新增信息本身的可靠性。

另一个值得琢磨的细节是任务类型的分布规律。CaSKG在颜色混合、导电测试这类需要多步骤连贯操作的任务上提升巨大,但在温度测量这种一步到位的直接测量任务上反而略微下降。这说明校准边关系这套机制,本质上是在给"需要记住上下文的复杂任务"减负,对于本来就简单直接的任务,额外的关系扩展可能反而引入了不必要的噪声。这个边界感挺重要,它提示我们不是所有检索场景都需要这么重的基础设施。

论文没有回答的一个问题是:这套反事实探测机制本身依赖大模型来打分,如果大模型自己的判断出现系统性偏差,比如对某类技能关系有认知盲区,这个偏差会不会被贝叶斯平滑悄悄放大而不是纠正?这个问题留给未来的工作去验证。

Q&A

Q1:CaSKG是什么?

A:CaSKG是一种给大语言模型智能体使用的技能检索框架,它通过反事实探测和贝叶斯校准来判断技能之间的依赖关系是否真实可靠,从而构建一张更精准的技能关系图,帮助智能体在执行任务时找到真正有用的操作步骤组合。

Q2:CaSKG相比GoS图检索方法提升了多少?

A:在六个大模型底座上的平均表现里,CaSKG把ScienceWorld的得分从72.62提升到80.50,把ALFWorld的成功率从80.01%提升到86.79%,并且在全部十二种模型与基准组合中都用了更少的环境交互步数。

Q3:为什么图检索有时候反而不如不检索?

A:因为图上的边如果建立在表面相似或巧合共现基础上,看似合理实则不可靠,一旦这种边参与关联度传播,就会把无关技能带入检索结果,论文中GPT模型的实验就出现过图检索得分低于全库暴露的情况。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
俄专家一针见血,中国若要对日本动手,中国只有两个选择!

俄专家一针见血,中国若要对日本动手,中国只有两个选择!

阿嘵田侃故事
2026-09-10 07:18:38
韩媒嘲讽长鑫HBM3良率仅25%:4个里3个是废品!拿什么追SK海力士;星宇股份又出错,外包报酬支付总额约2.44万亿元;iPhoneDuo被炒至9.9万

韩媒嘲讽长鑫HBM3良率仅25%:4个里3个是废品!拿什么追SK海力士;星宇股份又出错,外包报酬支付总额约2.44万亿元;iPhoneDuo被炒至9.9万

雷峰网
2026-09-11 08:30:02
扩大双向投资共促全球发展

扩大双向投资共促全球发展

人民网
2026-09-11 06:23:23
全国大风暴!政府采购、招投标全面严查!四类行为一律严惩!

全国大风暴!政府采购、招投标全面严查!四类行为一律严惩!

细说职场
2026-09-11 13:43:02
洛克菲勒:没事不要讲话——讲话只有三个目的,否则就闭嘴

洛克菲勒:没事不要讲话——讲话只有三个目的,否则就闭嘴

清风拂心
2026-08-23 11:10:09
CBA三大资讯,库珀突发意外,洛夫顿后悔离开上海,山东拿下射手

CBA三大资讯,库珀突发意外,洛夫顿后悔离开上海,山东拿下射手

体坛小快灵
2026-09-11 09:59:56
32张周总理罕见留影,最帅莫过军装照,难得一见值得收藏!

32张周总理罕见留影,最帅莫过军装照,难得一见值得收藏!

兴趣知识
2026-09-11 13:04:40
嘉峪关民政局正核查“男子停捐后遭受助学生质问”!原帖已删

嘉峪关民政局正核查“男子停捐后遭受助学生质问”!原帖已删

南方都市报
2026-09-11 12:44:56
郑爽一直都有更新动态!她还是想回归娱乐圈,不过这辈子估计没戏了

郑爽一直都有更新动态!她还是想回归娱乐圈,不过这辈子估计没戏了

扒星人
2026-09-10 14:20:53
卡里克真敢用!多古首次客串左后卫拿MVP,曼联左路隐患解决了?

卡里克真敢用!多古首次客串左后卫拿MVP,曼联左路隐患解决了?

体坛鉴春秋
2026-09-11 15:25:35
女教师带出5届状元班,优秀教师却落选,转身去私立,全年级挽留

女教师带出5届状元班,优秀教师却落选,转身去私立,全年级挽留

第四思维
2025-09-03 09:30:25
阵风被“击落”后,印加购114、埃24,越欲40、乌100,其它正交付

阵风被“击落”后,印加购114、埃24,越欲40、乌100,其它正交付

邵旭峰域
2026-09-11 13:34:36
浙江富豪陈天桥:我给美国捐70亿不假,但中国科学缺钱和我没关系

浙江富豪陈天桥:我给美国捐70亿不假,但中国科学缺钱和我没关系

五元讲堂
2024-10-15 14:48:49
男子发现大蛇绷直身体越过鸿沟,核心力量惊人!戏称是仙家在修炼

男子发现大蛇绷直身体越过鸿沟,核心力量惊人!戏称是仙家在修炼

狸猫之一的动物圈
2026-09-01 09:56:50
Lisa现身宝格丽,透视黑丝连裆裤露半腚,齐刘海金发梦回人间芭比

Lisa现身宝格丽,透视黑丝连裆裤露半腚,齐刘海金发梦回人间芭比

娱说瑜悦
2026-09-10 18:19:13
取消机关事业单位食堂、改发餐补或消费券,这钱到底能不能发?

取消机关事业单位食堂、改发餐补或消费券,这钱到底能不能发?

偷喝一口奶
2026-08-24 08:30:13
童颜配巨乳!56cm蚂蚁腰158cm童颜配黄金沙漏,甜辣平衡的天花板

童颜配巨乳!56cm蚂蚁腰158cm童颜配黄金沙漏,甜辣平衡的天花板

生如稗草
2026-09-08 12:30:47
绿荫做底色,碎花衬佳人

绿荫做底色,碎花衬佳人

真话情报局
2026-07-21 22:37:01
以色列炸地下堡垒引发4.1级地震

以色列炸地下堡垒引发4.1级地震

参考消息
2026-09-11 13:04:09
深成指跌逾2% 三市下跌个股近5200只

深成指跌逾2% 三市下跌个股近5200只

财联社
2026-09-11 10:41:03
2026-09-11 17:12:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9842文章数 568关注度
往期回顾 全部

科技要闻

罗永浩连用7个“抄的”吐槽苹果折叠屏

头条要闻

"男子称停资助遭受助学生质问"疑反转 民政局查无此人

头条要闻

"男子称停资助遭受助学生质问"疑反转 民政局查无此人

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

千叶珠宝创始人夫妇失联 股价应声"腰斩"

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

房产
教育
数码
时尚
健康

房产要闻

时隔7年,绿地海南再拿地!

教育要闻

为什么越在意孩子感受,孩子越脆弱

数码要闻

友通推工业ITX主板ARH171/ARH173,支持"MTL" "ARL"处理器

女人不管三十还是四十,衣服都可以多穿白色,清爽百搭又减龄

手脚发麻口齿不清?也可能是中风!

无障碍浏览 进入关怀版