网易首页 > 网易号 > 正文 申请入驻

CaSKG:给AI智能体的"技能记忆"装上一套谎言探测器

0
分享至


你有没有遇到过这种情况:办公桌上堆满了工具书,你要用的时候翻半天找不到,但如果只留一本工具书在手边,又总是缺那么一页关键内容?

这其实是所有"记忆管理系统"共同面对的老问题。而现在,这个问题落到了AI智能体身上,变得更棘手了。

大语言模型智能体*:能够自主调用工具、执行多步骤任务的AI程序,比如帮你订机票、玩文字游戏、甚至操作虚拟实验室的智能助手。

这些智能体越来越聪明,也越来越"健忘"。为了让它们不必每次都从零学起,研究者们给它们配备了技能库,把之前做成功的操作流程存起来,下次遇到类似任务直接调用。听起来很美好,但技能库越攒越大之后,一个新问题冒了出来:这么多技能,AI到底该从哪儿开始翻?

**这就是这篇论文要解决的核心矛盾:如何在数千条技能记录里,精准地找到那几条真正有用的,而不是把整个仓库倒给AI,也不是随便捞几个看起来沾边的。**

这事儿难在哪儿

先说说业内目前的三种做法,以及它们各自的坑。

第一种做法简单粗暴:全部展示。把整个技能库塞进AI的上下文窗口里,让AI自己挑。这样做的好处是不会漏掉任何有用的技能,但代价也很直白,AI要在几百上千条技能描述里做选择题,选择的负担全压在了它自己身上,还容易被无关选项带偏。

第二种做法是向量检索*:把每条技能的文字描述转换成一串数字(向量),通过计算这些数字之间的相似度来判断哪些技能和当前任务"长得像"。

这种方法能大幅压缩返回的技能数量,但它有个致命缺陷:它把每条技能当成孤立的文本单元来看待。可现实中的任务往往不是靠一条技能就能搞定的,你得先准备材料,再执行操作,最后还要检查结果对不对。这些互相依赖的技能,光靠"文字长得像不像"是判断不出来的。论文里提到一个很扎心的研究结论:文本检索得分本身,根本不能可靠地预测一个工具是否真的对当前任务有用。

第三种做法更进一步,叫图检索。既然技能之间有依赖关系,那就把这些关系画成一张图,节点是技能,边是它们之间的联系,检索时不光看文本相似度,还沿着图上的边把相关的技能也"捎带"出来。这里绕不开一个已有的工作,叫做Graph-of-Skills(简称GoS),它构建了一张技能依赖图,让工作流相关的技能能够进入检索结果,这确实解决了纯向量检索的一个大问题。

但图检索也有自己的麻烦。

**问题出在"边"上:一条边如果建立在表面的相似或者巧合的共现基础上,看起来煞有介事,实际上根本经不起推敲,一旦这种不靠谱的边参与到关联度的传播计算里,就会把不相关的技能也带进最终结果,污染整个检索质量。**

这就好比你在一个陌生城市问路,路人甲说"往前走能到火车站",路人乙说"往左拐能到火车站",你不知道谁说的靠谱,如果两条路都信,最后可能走进死胡同。图检索面临的正是类似的困境:候选关系摆在那儿一大堆,但到底哪些值得信任?

论文作者把这个问题提炼成了一句话:这不是要不要建更大的图的问题,而是一个预算有限条件下的边置信度校准问题。给定一堆看起来靠谱的候选关系,系统必须决定哪些边值得花力气去验证,验证后该给多少信任分,这份信任分又该如何控制关联度在图上的传播强度。

CaSKG的核心设计:先海选,再"逼供"

论文提出的方法叫CaSKG,全称是反事实因果技能图。

反事实推理*:一种"假如当初不这样,结果会怎样"的推理方式,比如假设去掉某个条件,看看事情是否还成立。

它的整体思路可以概括成四个步骤:先广撒网找候选关系,再挑一部分候选关系做"审讯",根据审讯结果给每条边打分归类,最后基于这张打磨过的图做检索。这四步分别对应候选图归纳、反事实边探测、边状态发布、任务导向检索。

我们一步步拆开看。

第一步:候选技能图归纳,先把网撒大

这一步的目标很简单,就是尽可能多地把"可能有关系"的技能对找出来,不追求精确,追求的是不漏掉。

具体来说,CaSKG综合了多种信号来判断两个技能之间是否可能存在关系:词面上的相似(描述用词接近)、语义上的相似(意思相近但用词不同)、输入输出接口是否兼容(一个技能的产出正好是另一个技能需要的原料)、以及在整体工作流中的结构位置(谁通常在谁前面,谁负责收尾)。如果有"修复证据"(一个技能能不能帮另一个技能擦屁股)或者引入大模型作为裁判进一步打分,这些信息也会被纳入考量。

这些信号会被加权平均,算出一个初始的关联分数,取值在0到1之间。特别地,如果某条边的结构信号特别强(比如它俩明摆着是工作流里紧挨着的两步),即便其他信号一般,系统也会给它兜底保留,不至于因为文字表述差异大就被漏掉。

这一步做完,会形成一个候选关系集合,论文的实验里,从1000个技能中筛出的候选关系接近一万条。

这就好比你想在一座陌生城市找靠谱的餐馆,第一步是先把大众点评上所有评分超过三星的店都列一遍,不管它是不是真好吃,先建立一个"可能不错"的名单。这个阶段的策略就是宁滥勿缺,因为漏掉的餐馆以后就再也没机会被发现了,而多列几家不好吃的,后面还有机会筛掉。

第二步:反事实边探测,把嫌疑犯拉去审问

光凭"看起来相关"是不够的,接下来CaSKG要对候选边动真格。但是全部一万条都验证一遍,成本太高,所以系统会挑出一个预算内的验证子集,对这部分候选边施加三种"审讯手段"。

第一种叫移除探测:把源技能从场景里直接抽走,看目标技能是不是废了。如果抽走之后目标技能明显不好使了,说明这个源技能对它来说是必要的,这叫必要性。

第二种叫替换探测:把源技能换成一个八竿子打不着的技能,看目标技能是不是照样受影响。如果换了之后目标技能表现下降,说明原来那个源技能不是随便什么技能都能顶替的,这叫专属性。

第三种叫重排探测:把提议中"谁在前谁在后"的顺序倒过来,看整个流程是不是还说得通。如果倒过来之后流程立刻乱套,说明这条边确实有方向性,不是可以随便颠倒的邻居关系,这叫顺序依赖。

**这三种探测手段共同回答的问题是:这条看起来相关的边,到底是真的操作上的依赖,还是仅仅因为两个技能话题相近才凑到一起的假象。**

这就像招聘面试里的背景调查。候选人简历写得天花乱坠(候选边的初始关联分很高),但你不能光看简历就录用他,你得打电话给他上一家公司核实(移除探测:如果他真离职了,上家公司业务是不是受影响),得看看换个人是不是也能干这活(替换探测:这人是不是可替代的),还得看看他的履历时间线对不对(重排探测:他说的经历顺序是不是符合逻辑)。如果跳过这些核实环节,直接按简历录用,结果往往是招进来一个金玉其外的人。

第三步:贝叶斯校准和边状态发布,给每条边定性

三种探测各自会返回一个支持度分数,CaSKG用一种叫贝叶斯平滑的统计方法把这三个分数汇总成一个综合的可信度指标。

贝叶斯平滑*:一种统计估计方法,通过给"先验假设"加权融合观测证据,避免因为数据量少而得出极端结论,让估计结果更稳健。

根据这个可信度指标,每条候选边会被打上四种标签之一:确认(这条边靠谱,全权重保留)、不确定(证据模棱两可,降权使用)、拒绝(证据明确反对,直接从图上抹掉)、未验证(没轮到它被审讯,只保留极少一部分作为兜底的骨架,权重压得很低)。

这个设计非常关键:**它不是简单的"留"或"删"二元判断,而是一个带有置信度梯度的连续过滤机制,让证据强的关系享有更大话语权,证据弱的关系影响力被主动削弱。**

想象一个新闻编辑部收到很多线人爆料。总编不能每条爆料都当头条发(那样假新闻满天飞),也不能因为核实成本高就干脆什么都不发(那样漏掉真新闻)。合理的做法是核实充分的消息大版面刊登,核实一半的消息放在角落小字提醒,明确证伪的消息直接毙掉,还没来得及核实的留一条小尾巴以防万一是真的。这正是CaSKG边状态发布机制想要模拟的编辑逻辑。

第四步:任务导向检索,让校准过的图开始干活

图建好之后,检索阶段用的是个性化PageRank*:一种网页排名算法的变体,从查询相关的"种子节点"出发,沿着图上的边扩散相关性,边越靠谱、越集中,扩散出的结果越聚焦。

给定一个任务查询,系统先用词面和语义匹配找出几个种子技能,然后让相关性沿着刚才校准好的图向外扩散,扩散过程中会不断地"折返"回种子技能附近,防止跑偏太远。最终排名靠前的技能被打包返回给下游智能体使用。

整个流程里,图的构建是离线完成的,也就是提前算好、封存起来,不会在智能体执行任务的过程中临时调整,这样做的好处是不会给在线推理增加额外的计算负担,也不会改变智能体本身的决策逻辑。

实验结果说了什么

论文在两个交互式基准测试上验证了CaSKG的效果:ALFWorld,一个模拟家庭场景任务的环境,涉及找物品、开关电器、移动物品等操作;ScienceWorld,一个模拟科学实验的环境,涉及测量、分类、化学反应观察等步骤。

实验覆盖了六种大模型底座,包括MiniMax、GLM、Kimi、Qwen、DeepSeek和GPT系列的最新版本。

| 方法 | ALFWorld成功率均值 | ScienceWorld得分均值 |

| 全库暴露 | 73.30% | 67.71 |

| 向量检索 | 74.05% | 68.20 |

| GoS(图检索基线) | 80.01% | 72.62 |

| **CaSKG** | **86.79%** | **80.50** |

(注:均值为按六个模型简单平均计算得出,用于直观展示整体趋势)

数据很直白:**CaSKG在全部十二种模型与基准的组合里都拿到了最高分,而且在所有组合中都比GoS用了更少的环境交互步数**。

这里有个细节值得多说两句。改进幅度在不同模型上并不均匀。表现较弱的MiniMax模型,在ScienceWorld上从GoS的55.85分跳到CaSKG的68.33分,提升了12.48分;而已经接近满分的GLM模型,提升幅度收窄到4.78分。这说明CaSKG最擅长的场景,是模型本身需要检索系统补充缺失的操作步骤知识时,而不是模型已经很强、自己就能搞定大部分任务的时候。

还有一个有意思的反常案例。在ALFWorld上测试GPT-5.6-Luna这个模型时,向量检索和GoS的表现反而都比什么都不做(全库暴露)还差,向量检索只有55%,GoS也只有60.71%,而全库暴露有72.86%。这说明如果图里混进了太多误导性的边,图检索有可能比不检索还糟糕。CaSKG在这个案例里拿到了75.71%,重新夺回了检索方法应有的优势。

**这个反常案例其实是全篇最有说服力的证据:它证明了图结构本身不天然带来收益,真正决定成败的是图上那些边到底靠不靠谱。**

具体案例:一次导电测试的完整对照

论文里给了一个很生动的例子。任务是判断食盐是否导电,正确流程需要五步:聚焦材料、搭建电路、观察结果、给材料分类、把它放进对应的盒子。

用CaSKG的智能体,检索到的技能包正好覆盖了导电测试、电路搭建连接、材料分类、最终放置这四个环节,24步就完成任务,拿了满分100分。

用GoS的智能体,混进了一些无关的工具类技能,智能体花了大量步骤在修复错误的连接指令上,30步用完只拿到55分。

用向量检索的智能体,检索结果几乎全是不相关的技术工具,根本没形成一个能跑通的电路方案,只拿了5分。

**这个例子直观地展示了CaSKG的优势所在:它返回的不是单独一个"导电测试"技能,而是一整条准备、操作、验证、放置的完整依赖链条。**

规模测试:库越大,优势越明显吗

论文还测试了技能库从200条扩到2000条时,CaSKG相对GoS的优势是否稳定。结果显示,在MiniMax模型上,无论库规模是200、500、1000还是2000,CaSKG始终领先GoS,领先幅度从7.14到22.86个百分点不等,在500条规模时差距最大。Qwen模型上也呈现类似规律。

这说明校准图边这件事,不是小规模玩具场景下的取巧,规模变大之后依然有效,甚至在中等规模下优势最明显,因为这时候候选关系的噪声干扰最容易积累。

拆解实验:每个部件到底贡献了多少

论文做了消融实验,把CaSKG拆开来看每个组件单独的作用。

如果只用语义相似度构建候选图(去掉词面、输入输出、结构信号),成功率从73.57%掉到67.14%,说明多信号融合确实能捞到那些"语义上不像但操作上有关联"的技能对。

如果去掉大模型裁判打分环节,成功率从73.57%降到71.43%,说明这个额外的裁判环节能进一步修正边界模糊的关系判断。

如果把所有候选边不做筛选全部发布(跳过反事实探测和状态过滤),成功率是71.43%,比完整版本低了两个百分点,同时候选边数量从最终发布的3292条暴涨到全部9937条。

**这组对比清楚地证明了一件事:图并不是越密越好,经过校准筛选后只保留三分之一左右的边,反而比全部发布效果更好。**

这就像一个人脉网络。你手机通讯录里存了两千个联系人,但真正能在关键时刻帮上忙的,可能只有两百个。如果遇到事情就把两千个人的电话全打一遍,不仅浪费时间,还可能被一堆不靠谱的建议带偏方向。真正聪明的做法是提前分辨出哪些人靠谱,关键时刻只联系那批人。

写在后面

读完这篇论文,最让我意外的一点是那个GPT-5.6-Luna的反常案例。它打破了一个我原本下意识觉得理所当然的假设:图检索天生比向量检索强,因为它多了一层关系信息。但数据摆在那里,向量检索55%,图检索反而更差只有60.71%,这说明多一层结构信息如果质量不过关,反而是负担而不是助力。这提醒我,在评价任何"加了更多信息"的系统时,不能只看信息量的增加,还得追问这些新增信息本身的可靠性。

另一个值得琢磨的细节是任务类型的分布规律。CaSKG在颜色混合、导电测试这类需要多步骤连贯操作的任务上提升巨大,但在温度测量这种一步到位的直接测量任务上反而略微下降。这说明校准边关系这套机制,本质上是在给"需要记住上下文的复杂任务"减负,对于本来就简单直接的任务,额外的关系扩展可能反而引入了不必要的噪声。这个边界感挺重要,它提示我们不是所有检索场景都需要这么重的基础设施。

论文没有回答的一个问题是:这套反事实探测机制本身依赖大模型来打分,如果大模型自己的判断出现系统性偏差,比如对某类技能关系有认知盲区,这个偏差会不会被贝叶斯平滑悄悄放大而不是纠正?这个问题留给未来的工作去验证。

Q&A

Q1:CaSKG是什么?

A:CaSKG是一种给大语言模型智能体使用的技能检索框架,它通过反事实探测和贝叶斯校准来判断技能之间的依赖关系是否真实可靠,从而构建一张更精准的技能关系图,帮助智能体在执行任务时找到真正有用的操作步骤组合。

Q2:CaSKG相比GoS图检索方法提升了多少?

A:在六个大模型底座上的平均表现里,CaSKG把ScienceWorld的得分从72.62提升到80.50,把ALFWorld的成功率从80.01%提升到86.79%,并且在全部十二种模型与基准组合中都用了更少的环境交互步数。

Q3:为什么图检索有时候反而不如不检索?

A:因为图上的边如果建立在表面相似或巧合共现基础上,看似合理实则不可靠,一旦这种边参与关联度传播,就会把无关技能带入检索结果,论文中GPT模型的实验就出现过图检索得分低于全库暴露的情况。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
华尔街日报爆猛料:美国很多癌症患者正飞往上海治病,费用不到美国一半

华尔街日报爆猛料:美国很多癌症患者正飞往上海治病,费用不到美国一半

小徐讲八卦
2026-09-09 07:58:10
止步半决赛结束最后一舞!美国网球名将退役,曾6夺大满贯冠军

止步半决赛结束最后一舞!美国网球名将退役,曾6夺大满贯冠军

全景体育V
2026-09-11 15:15:45
泽连斯基:全世界都在等待乌克兰战胜俄罗斯那个混蛋!

泽连斯基:全世界都在等待乌克兰战胜俄罗斯那个混蛋!

老马拉车莫少装
2026-07-06 01:58:00
5年每月1500元,男子停资助遭女生质问:尽快打过来不然曝光你!最新回应

5年每月1500元,男子停资助遭女生质问:尽快打过来不然曝光你!最新回应

上观新闻
2026-09-10 10:01:26
刘翔恩师现状:住上海,两省都发工资,每日2包烟,70岁身体硬朗

刘翔恩师现状:住上海,两省都发工资,每日2包烟,70岁身体硬朗

李橑在北漂
2026-08-28 14:11:35
领导干部任职前公示

领导干部任职前公示

锡望
2026-09-11 10:20:04
巴西矿商终于说出实话:把稀土低价卖给欧美,就是为了对付中国?

巴西矿商终于说出实话:把稀土低价卖给欧美,就是为了对付中国?

荐史
2026-09-11 12:53:11
中国M2已是美国2.2倍,为何国内物价水平没有显著上涨?

中国M2已是美国2.2倍,为何国内物价水平没有显著上涨?

罗sir财话
2026-09-10 22:20:33
两性专家说:做老婆的,别管男人跟谁睡,他出去了,不在你身边,你管他干什么?只要不要损害这个家庭的经济利益,就不要生闲气

两性专家说:做老婆的,别管男人跟谁睡,他出去了,不在你身边,你管他干什么?只要不要损害这个家庭的经济利益,就不要生闲气

心理观察局
2026-09-11 06:59:05
台湾退役中将帅化民表示,张学良被关一生不能算冤,因为西安事变那一夜,他差点让蒋介石从奉化带来的嫡系护卫全军覆没

台湾退役中将帅化民表示,张学良被关一生不能算冤,因为西安事变那一夜,他差点让蒋介石从奉化带来的嫡系护卫全军覆没

谈史论今1
2026-09-06 20:22:18
千叶珠宝创始人夫妇失联,股价应声“腰斩”!有员工称被欠薪

千叶珠宝创始人夫妇失联,股价应声“腰斩”!有员工称被欠薪

红星资本局
2026-09-11 16:12:11
再见17!iPhone18彻底补全所有短板,刚买17的人心态崩了

再见17!iPhone18彻底补全所有短板,刚买17的人心态崩了

小柱解说游戏
2026-09-09 02:05:46
女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

看世界的人
2026-08-07 09:22:50
瑞浦兰钧回应“员工在厂区裸奔”:员工因离职手续流程未达成一致情绪失控,限制员工如厕不实

瑞浦兰钧回应“员工在厂区裸奔”:员工因离职手续流程未达成一致情绪失控,限制员工如厕不实

极目新闻
2026-09-10 18:56:30
黄晓明说“我帮了太多白眼狼”,“黄晓明在内涵谁”登上热搜

黄晓明说“我帮了太多白眼狼”,“黄晓明在内涵谁”登上热搜

韩小娱
2026-09-11 06:56:59
男子自曝妻子出轨大尺度聊天内容,对方只给他妻子买过情趣内衣

男子自曝妻子出轨大尺度聊天内容,对方只给他妻子买过情趣内衣

四海神君
2026-09-11 13:30:03
当初号称绝密计划!“最美雷克萨斯”新车官宣

当初号称绝密计划!“最美雷克萨斯”新车官宣

米粒说车唯一呀
2026-09-11 13:44:49
成都市大邑一栋三百多平的别墅降价拍卖,被人捡漏底价227万竞得

成都市大邑一栋三百多平的别墅降价拍卖,被人捡漏底价227万竞得

童童聊娱乐啊
2026-09-11 11:33:59
深圳宝安警方通报“江西台记者采访被掌掴”:打人者已被行政拘留

深圳宝安警方通报“江西台记者采访被掌掴”:打人者已被行政拘留

每日经济新闻
2026-09-11 14:43:09
官方通报、军媒痛批!郭德纲风波后再惹众怒,原来他还有一张底牌

官方通报、军媒痛批!郭德纲风波后再惹众怒,原来他还有一张底牌

青橘罐头
2026-09-10 11:30:56
2026-09-11 18:00:50
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9842文章数 568关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

3名俄男子被乌女特工"招募" 女方发送自己的火辣照片

头条要闻

3名俄男子被乌女特工"招募" 女方发送自己的火辣照片

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

千叶珠宝创始人夫妇失联 股价应声"腰斩"

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

健康
亲子
本地
公开课
军事航空

手脚发麻口齿不清?也可能是中风!

亲子要闻

经济拮据,全职宝妈鼓起勇气出来找工作!找到满意岗位却陷入两难:伸手找老公拿家用,还是出门挣工资?

本地新闻

拼假 13 天国内长线路线合集

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

涉伊朗核问题 中国和俄罗斯投下反对票

无障碍浏览 进入关怀版