网易首页 > 网易号 > 正文 申请入驻

当AI员工犯错时,我们能不能提前十分钟看出来

0
分享至


2024年,有一群做智能体(能自己执行任务的AI程序)研究的工程师发现了一件很别扭的事。

他们让AI去修代码仓库的bug,让AI去逛购物网站买东西,让AI去操作电脑桌面完成任务。每一次,AI都会留下一长串执行记录,先搜索文件,再打开某个工具,再调用另一个接口,反反复复几十上百步。任务做完了,这份记录也就跟着归档了,没人会去仔细看它。

问题是,这些记录里其实藏着规律。

一个修代码的AI大概率会按照“搜索问题所在文件→修改代码→执行测试”这样的节奏循环。一个客服AI会不停地在“查数据库”和“回复用户”之间来回切换。这些行为模式明明是有结构的,可是没人把它们提炼出来。每次出了问题,工程师只能翻着几百行的原始日志一行行找线索,就像大海捞针。

这篇发表于2026年ICML研讨会的论文《Automata from Agent Traces: Failure and Next-Step Prediction》要解决的就是这件事:能不能把一整个AI智能体的行为记录库,压缩成一张地图,让人一眼就能看出这个AI通常怎么工作、什么时候容易出问题、下一步大概率会做什么。

这事到底难在哪

先说说这个问题为什么不是随便写几行统计代码就能解决的。

**智能体*:这里特指基于大语言模型构建、能自主执行多步骤任务的AI程序,比如自动修bug的编程助手、自动浏览网页完成购物的AI、自动操作电脑桌面的AI

如果你只看单条执行记录,会发现每次任务的具体步骤都不太一样:这次搜索了三个文件,那次搜索了五个;这次先编辑再测试,那次因为报错又多绕了一圈。要是死板地把每一条独特的路径都记下来当成一个“状态”,你会得到一张巨大无比、几乎没法看的图,因为几乎每条记录的细节都是唯一的。

学术界处理这类“从例子中总结规律”的问题,有个绕不开的理论障碍。

**哥德尔极限(Gold's theorem)*:1967年由E. M. Gold提出的一个理论结果,大意是说,如果你只能看到“正确的例子”而看不到“错误的例子”,那么想要百分之百精确地还原出生成这些例子的规则,在数学上是不可能的

这一点对于AI智能体的行为记录来说是致命的。因为你手里拿到的所有交易记录都是这个AI真实执行过的,全都是“正例”,你没有一份“这个AI绝对不会做的事”的清单去做对照。这就好比你想弄清楚一个陌生小镇的所有交通规则,但你只能看别人开车的录像,永远看不到交警的处罚记录,你怎么知道哪条路是单行道,哪个路口不能左转?

正因为如此,之前学界研究“从例子里学出一个状态机”的经典算法(比如RPNI、EDSM这些,本质上都是想把观察到的行为序列合并压缩成一张紧凑的图),碰到智能体的行为记录时统统失灵了。论文里给出了具体的数字:用经典算法RPNI处理一个叫SWE-agent的编程智能体的两千条记录,最后得到的状态机有五万九千五百一十个状态,跑一遍测试数据的“回放成功率”(后面会解释这是什么)只有0.646,也就是三分之一以上的步骤根本对不上号。

这就是这篇论文出发时面对的现实:想要的东西(一张紧凑清晰、能看懂的行为地图)在理论上被证明拿不到完美解,而现成的工具算出来的地图又大又乱,根本没法用。

研究者的关键洞察:智能体的“词汇量”其实很小

论文作者们没有去正面挑战哥德尔极限,而是找到了一个绕过去的角度。

他们注意到一件事:智能体虽然每次任务的具体路径千变万化,但它能做的“动作种类”其实非常有限。一个编程智能体翻来覆去也就是搜索、编辑、执行、提交这么几个大类的操作;一个客服智能体来来回回也就是查订单、查用户信息、回复用户这几种工具调用。

论文里统计了十二个公开数据集,发现这些智能体使用的“动作字母表”大小只有6到42个符号。换句话说,虽然每次执行的具体序列长度可能有几十上百步,但组成这些序列的“基本单词”非常少。

**有限状态机(FSM, Finite State Machine)*:一种数学模型,用一组“状态”和状态之间的“转移规则”来描述一个系统的行为,你可以把它想成一张地图,每个地点是一个状态,每条路是一次动作

这个观察很关键,因为它意味着,如果按照动作类型而不是完整路径来划分状态,状态的总数就不会随着记录条数的增加而爆炸性增长。这就好比你要给一座城市画交通图,如果按照“每辆车具体走过的路线”来画,永远画不完,因为每辆车的路线都不同;但如果按照“这座城市一共有哪些路口和道路”来画,图会非常稳定,因为路口的数量是有限的,不会因为车流量增加而变多。

基于这个洞察,作者设计了一套构造方法,三步走。

第一步,把所有的执行记录塞进一棵前缀树(一种树形结构,相同的开头路径会共享同一段分支)。这一步得到的树非常忠实,能完美还原每一条原始记录,但状态数量极其庞大,因为几乎每条独特的记录都会撑开新的分支。

第二步,也是最核心的一步,按照“最后一次做的动作类型”把树上的节点合并。具体来说,如果两个节点是通过同一种动作到达的(比如都是刚执行完“编辑代码”这个动作),无论它们之前走过什么样的路径,都合并成同一个状态。这一步一下子就把状态数量压缩到了“动作种类数加一”这个规模,因为不管你之前绕了多少弯路,只要你现在处于“刚编辑完代码”这个状态,你接下来大概率会做的事情是相似的。

第三步是做一些清理,把那些在整个语料库里只出现过一次、而且不是唯一选择的“偶发性”转移路径过滤掉,避免个别的怪异操作污染整张图。

论文对这套方法做了严格的数学证明,证明这个合并过程不会丢失训练数据里已经验证过的路径(也就是说,如果一条记录在没合并之前能被完整还原,合并之后依然能被完整还原),而且这个构造过程是完全确定性的,同样的数据永远得到同样的图,不需要调任何超参数。

这里要打个比方帮你理解为什么“按最后动作合并”这个设计如此重要。

想象你在整理一个公司的会议纪要,如果你按照“具体是哪次会议、参会人员是谁、讨论了几个议题”来归档,你会积累成千上万份互不相同的档案,永远找不出规律。但如果你换一个角度,按照“这次会议是不是刚开完预算讨论”来归类,你会发现,不管前面聊了什么,只要是刚开完预算讨论,接下来大概率是财务部门发言或者休会。这种按“当下所处阶段”而不是“完整历史路径”来分类的方式,恰恰是从一堆看似杂乱的记录里提炼出可操作规律的关键。如果不这样做,坚持按完整路径归档,你得到的档案柜会塞满几万个几乎从不重复的文件夹,翻找起来和大海捞针没有区别。

这套构造方法效果如何?论文用十二个公开数据集做了验证,结果相当惊人。最终得到的状态机只有7到43个状态,构造过程只需要几十到一百多毫秒,而在测试数据上的“回放成功率”高达0.997以上。

**回放成功率(Replay Fitness)*:把一条新的执行记录喂给已经构造好的状态机,看这张图能不能顺着走完整条记录而不掉链子,能走完的步骤比例就是这个指标

和之前提到的RPNI相比,在SWE-agent这个数据集上,压缩比达到了2380倍,也就是说别人要用两万多个状态才能勉强描述的行为规律,这套方法只用25个状态就说清楚了,而且回放成功率还从0.646提升到了0.999。

有了这张图,能做什么

光是把行为记录压缩成一张小图还不够震撼,真正让人眼前一亮的是,这张图能同时干四件不一样的活,而以往这四件事需要四套完全不同的系统来分别解决。

### 第一件事:预测AI下一步大概会做什么

有了状态机之后,你只要知道AI现在处于哪个状态,就可以统计历史上处于这个状态的所有记录,接下来最常做的是什么动作,直接给出一个概率分布。

论文用一个叫“交叉熵”的指标衡量预测的准确程度,数值越低说明预测越准。结果显示,仅仅靠这个最简单的“看当前状态猜下一步”的方法,平均交叉熵是0.934比特,比什么都不做(均匀猜测)的3.474比特降低了73%,比稍微聪明一点的“看历史上哪个动作出现频率最高”这种不考虑状态的方法(2.439比特)也降低了62%。

这个提升有多大呢?换个说法,交叉熵每降低1比特,大致相当于预测的不确定性减半。从2.4多比特降到0.93比特,意味着预测这件事变得容易了三四倍。

论文还做了一个很有意思的对比实验,是关于给大语言模型提供什么样的“上下文提示”效果最好。研究者拿这套状态机的信息去跟一个现成的方法**Agent Workflow Memory (AWM)*:一种从成功的执行记录里提炼出线性工作流程,供AI参考的记忆机制,简称AWM

做对比。结果是,在全部八个有标注数据的测试里,用状态机信息作为提示,全部赢过AWM,胜幅最大的一个案例(SWE-smith数据集)领先了整整25.3个百分点。

但这里有个反直觉的细节值得说一下。研究者试了四种不同的方式把状态机信息塞进提示词,本以为信息越详细、把整张图的所有状态和转移关系都列出来效果会最好,结果恰恰相反。那种“把所有状态和所有转移关系全都列出来”的详尽版本(论文里叫ASG-full)表现只有52.2%的准确率,反而不如AWM的52.9%;而只给出“当前状态下最可能的下一步动作概率,加上未来十五步内最常见的几条延续路径”这种精简版本(ASG-minimal),准确率飙到了65.1%,比AWM高出12.9个百分点。

这个反差说明了一件很朴素的道理,信息不是越多越好,太详细的说明反而会把关键信号淹没掉。这就像你问一个人怎么走去最近的地铁站,最有用的回答是“直走两百米右转”,而不是把这座城市所有的地铁线路图和历史沿革全部打印给他。信息过载会让接收方(不管是人还是AI)找不到重点,而恰到好处的精简提示反而能让决策更快更准。

### 第二件事:提前预判AI会不会失败

这是这篇论文里最实用的部分。研究者把每条执行记录“回放”一遍这张状态机地图,记录下这条记录在每个状态上停留了多久、消息长度、出错频率、以及五个跟“惊讶程度”有关的指标(比如某一步的动作有多不符合历史规律),拿这些特征去训练一个分类器,判断这条记录最终是成功还是失败。

结果在九个有标注的数据集上,**AUROC(一种衡量二分类模型区分能力的指标,取值0到1,0.5相当于瞎猜,1.0代表完美区分)*最高达到了0.94(在tau2-bench电信客服数据集上),普遍在0.78到0.94之间。

有个细节特别值得展开讲讲。研究者发现,光看“回放成功率”本身几乎没有预测力(AUROC约等于0.5,跟瞎猜没区别),但是把这张地图的“状态特征”拆解出来喂给分类器,效果立刻就上来了。这说明单纯问“这条记录符不符合常见套路”是不够的,真正有用的信息藏在“这条记录具体在哪些状态上花了多少时间、犯了多少错”这种细粒度的拆解里。

在SWE-agent这个编程智能体数据集上,研究者还专门做了一个对照实验:如果只看记录的长度(步数多少)来预测成败,AUROC只有0.659;而用这套基于状态的结构化特征,AUROC能到0.790。这个差距证明了失败的信号不是简简单单“这个任务花了更多步骤”,而是这个AI具体在哪些状态之间反复兜圈子。

论文里给出一个特别生动的例子:在SWE-agent上,成功完成任务的记录只用到了25个状态里的9个,走的是一条很专注的路径(搜索、编辑、提交),而失败的记录几乎把全部25个状态都用上了,到处乱窜。两组记录之间的路径重合度(专业说法叫Jaccard相似度)只有0.206,说明成功和失败在行为模式上几乎是两个完全不同的故事。

这里可以打个比方。想象你在看两个学生做同一道数学题的草稿纸,做对的学生草稿纸上只有寥寥几行,思路清晰地一步步推导下去;做错的学生草稿纸上写满了各种尝试,划掉又重写,来回折腾。你不需要看最终答案,光看草稿纸上“折腾的痕迹”就能大致猜出谁做对了谁做错了。这套状态机干的就是这件事,把AI的“草稿纸”量化成可统计的特征。

### 第三件事:还没做完就喊停

比失败预测更进一步的,是能不能在任务还没跑完的时候就提前发现苗头不对,及时叫停,省下后续的计算资源。

论文设计了一个在线监控器,核心是盯着两个信号:一个是“循环率”,也就是这条记录在最近走过的路径里,有多大比例是在重复之前访问过的状态,另一个是访问过的独特状态数量是否达到一个基本门槛。

结果显示,在SWE-agent这个数据集上,监控器能在任务只完成32%的时候就触发预警,此时预测的精确度达到85.9%,召回率达到95.5%,意味着能省下68%的剩余计算量。论文还给出了一个更保守但零误报的操作模式:把循环率的触发门槛调得更高一些,可以做到100%精确率(一次误报都没有),虽然只能抓到11.3%的失败案例,但作为“确信度极高才叫停”的策略是很有价值的。

图4里那个对比图特别直观:一条失败的记录,它的循环率曲线在很早期就窜到了0.8以上,超过了0.778这个阈值线,卡在“用户”和“编辑”两个状态之间来回打转;而一条成功的记录,循环率始终压在0.636以下,稳步走向新的状态直到完成任务提交。两条曲线的分岔在整个执行过程的三成左右就已经很明显了。

这套逻辑不需要任何机器学习模型,纯粹靠状态机回放的统计规律,每一步的判断只要0.006毫秒,完全可以嵌入到真实的AI系统运行环境里做实时监控。

如果不做这种早停机制会怎样?答案很直接:AI会继续跑完整个失败流程,把后面本可以省下的计算全部浪费掉。这就好比一个厨师炒菜炒到一半已经明显糊了,锅里冒黑烟了,如果坚持按流程炒完再尝味道,浪费的不只是这盘菜,还有炉火和时间。早停机制相当于在冒烟的那一刻就把火关掉,虽然这盘菜肯定是废了,但至少省下了继续烧下去的成本。

### 第四件事:压缩,把几万个状态变成几十个

这部分前面已经提过压缩比的数字,这里补充说明一下为什么“压缩”本身是件值得单独拎出来说的事。

一个只有7到43个状态的图,人是可以打开看、可以理解、可以手工审查的。一个五万九千个状态的图,除了让计算机去跑,人根本没法用眼睛去审计。安全审计这件事,说到底需要的是人能看懂系统在做什么,而不是把黑箱换成另一个更大的黑箱。这套方法把原本不可读的海量日志,压缩成了人类审计员真正能坐下来逐一检查的规模。

一个有意思的发现:AI的行为模式可能跟具体用的是哪个大模型关系不大

论文还做了一个跨模型的实验,很有意思。他们在tau2-bench这个客服场景的数据集上,收集了四种不同大语言模型(GPT-4.1、Claude 3.7 Sonnet、GPT-4.1-mini、o4-mini)执行相同任务的记录,然后用一张综合了所有模型记录的状态机去分别检验每个模型单独的表现。

结果是,这张综合状态机在每个模型上单独测试都达到了1.000的回放成功率。也就是说,不管背后驱动这个AI的是哪家公司的哪个模型,它们走的行为路径高度雷同,只是在具体的转移概率上有差别。用论文里的话说,不同模型之间共享了80%到92%的“主干转移路径”。

这个发现有一定的颠覆性,它暗示了智能体的行为结构,更多是由“系统怎么搭的”(用了哪些工具、给了什么样的提示词模板、任务分布是什么样)决定的,而不是由“大脑用的是哪个模型”决定的。这就好比不管你请哪位大厨来做这道菜,只要用的是同一份菜谱、同一套厨具、同一个厨房布局,做出来的流程步骤大体相似,真正体现厨师个人风格的可能只是火候和调味这些细节,而不是先切菜后炒制这个大框架。

不过这个跨模型的迁移能力不是完美的。当用A模型训练出的失败预测特征去预测B模型的失败情况时,AUROC平均下降了0.091,从自身模型内的0.877掉到跨模型的0.786。这说明虽然大框架是共享的,但每个模型确实有一些自己独特的失败方式,没法完全通用。

写在后面

读完这篇论文,最触动我的其实不是那些漂亮的AUROC数字,而是那个反直觉的“信息越少反而效果越好”的实验。研究者原本大概率是想着把状态机的所有细节一股脑塞给大模型,觉得信息越全面判断力越强,结果发现精简的版本反而赢了12.9个百分点。这个结果其实在提醒一件更普遍的事:我们习惯性地认为给AI喂更多上下文一定更好,但真实情况可能是,过量的、未经筛选的上下文会稀释掉真正关键的那一小撮信号。这跟人类做决策时的“信息过载”现象几乎是同一个道理,只是发生的场景换成了大模型的提示词工程。

另一个让我反复琢磨的地方,是那个跨模型迁移的实验。如果智能体的行为结构真的更多由“部署框架”而不是“底层模型”决定,那这对整个行业的安全审计思路可能是个提醒:与其花大力气针对每个新模型单独做行为分析,不如先把审计的重点放在系统架构本身,工具怎么调用的、提示词怎么设计的、任务边界怎么划的。这或许比追着每一代新模型跑评测更划算。

论文没有解决的问题也很明显,这套方法对付的是工具数量有限、动作种类清晰的场景,一旦AI的动作空间变得极其庞大或者行为规律很弱,这张紧凑的地图可能就画不出来了。未来的智能体如果拥有更自由、更开放式的行动能力,这套基于有限字母表的思路还能不能撑住,是个值得持续追问的事。

Q&A

Q1:这篇论文提出的有限状态机方法主要解决什么问题?

A:主要解决AI智能体(能自主执行多步骤任务的AI程序)行为记录难以审计和监控的问题。研究者把一整个语料库的执行记录压缩成一张只有7到43个状态的紧凑地图,用它来预测AI下一步会做什么、判断任务会不会失败、并且能在任务还没跑完时提前叫停有问题的执行。

Q2:这套方法和之前的自动机学习算法(比如RPNI)相比优势在哪?

A:最大的优势是压缩比和实用性。传统方法RPNI在处理智能体记录时会产生几万个状态(比如SWE-agent数据集上产生59510个状态),而且回放成功率只有0.646;这篇论文的方法只需要25个状态就能达到0.999的回放成功率,压缩比最高达到3036倍,而且构造过程完全确定、不需要调超参数,几十毫秒就能建好。

Q3:这套状态机能不能提前预测AI任务会失败?

A:可以,而且效果不错。研究者把每条记录在状态机上回放后提取的特征喂给分类器,在九个数据集上失败预测的AUROC最高达到0.94。更实用的是,还设计了一个在线监控器,能在任务只完成32%的时候就触发预警,精确度85.9%,召回率95.5%,可以省下68%的后续计算资源。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
啊!约基奇可能直接离开NBA....

啊!约基奇可能直接离开NBA....

柚子说球
2026-09-16 23:13:36
网传上海有209万大龄剩女,北京有223万大龄剩女,评论区炸锅...

网传上海有209万大龄剩女,北京有223万大龄剩女,评论区炸锅...

慧翔百科
2026-09-16 17:32:38
画面不堪入目,地下人奶交易乱象,成年人躺进怀里吃奶的灰色黑产

画面不堪入目,地下人奶交易乱象,成年人躺进怀里吃奶的灰色黑产

易玄
2026-09-12 10:24:46
印度小伙来中国,与中国姑娘交往2个月被踹,姑娘:我现在全身病

印度小伙来中国,与中国姑娘交往2个月被踹,姑娘:我现在全身病

悬案解密档案
2025-05-21 10:46:02
被全网嘲讽的嘎子,在自家院子秀身手,身后4辆车却抢了镜

被全网嘲讽的嘎子,在自家院子秀身手,身后4辆车却抢了镜

总李谈车
2026-09-16 20:16:54
改变中国命运的6位伟人:若没有他们,中国不会有今天的辉煌成就

改变中国命运的6位伟人:若没有他们,中国不会有今天的辉煌成就

壁炉公子
2026-09-16 07:25:12
南方医科大学一学生坠亡,与导师聊天记录曝光,家属最新发声:网传均为谣言!

南方医科大学一学生坠亡,与导师聊天记录曝光,家属最新发声:网传均为谣言!

上观新闻
2026-09-17 08:27:31
美媒:中国“地下导弹城”罕见曝光,规模远超伊朗“导弹城”,核心作用并非“扛炸”

美媒:中国“地下导弹城”罕见曝光,规模远超伊朗“导弹城”,核心作用并非“扛炸”

蓝星杂谈
2026-09-16 18:52:03
30万斤堆积如山,树上6万斤无人问津,低价卖不动,农民满心无奈

30万斤堆积如山,树上6万斤无人问津,低价卖不动,农民满心无奈

三农雷哥
2026-09-05 12:16:13
乌总长连夜出逃!专家预判:泽连斯基最后会甩锅向俄求和

乌总长连夜出逃!专家预判:泽连斯基最后会甩锅向俄求和

郭蛹包工头
2026-09-17 10:41:25
江阴已出现!别吃!别碰!寄生虫多达6000条,严重可致死!

江阴已出现!别吃!别碰!寄生虫多达6000条,严重可致死!

最江阴
2026-09-16 10:41:44
75岁老太旅游被骗买了一件佛陀木雕,4年后,她得了6套海景房

75岁老太旅游被骗买了一件佛陀木雕,4年后,她得了6套海景房

磊子讲史
2025-07-07 12:41:11
中国哪个地方的兵源最好?网友:打仗东北兵源最好,吃苦西北兵源最好

中国哪个地方的兵源最好?网友:打仗东北兵源最好,吃苦西北兵源最好

带你感受人间冷暖
2026-08-24 00:05:32
敬一丹追悼会:央视大人物到齐,唯独好友倪萍缺席 用写信弥补遗憾

敬一丹追悼会:央视大人物到齐,唯独好友倪萍缺席 用写信弥补遗憾

动物奇奇怪怪
2026-09-17 12:42:52
A股调整到3876点,若无意外,明天周五,9月18日,很可能这样走了

A股调整到3876点,若无意外,明天周五,9月18日,很可能这样走了

虎哥闲聊
2026-09-17 15:07:32
尴尬了!合肥安全标语牌闹出低级乌龙:“擦拭”写成“擦试”,错别字出圈

尴尬了!合肥安全标语牌闹出低级乌龙:“擦拭”写成“擦试”,错别字出圈

火山詩话
2026-09-17 10:30:25
敬一丹灵堂遗照曝光,女儿丈夫悲伤露面,董卿、朱军穿黑衣送别

敬一丹灵堂遗照曝光,女儿丈夫悲伤露面,董卿、朱军穿黑衣送别

小疯子耶
2026-09-17 14:52:23
同学聚会问我退休金,我故意说2300元,没想到,第二天接到了25个电话……

同学聚会问我退休金,我故意说2300元,没想到,第二天接到了25个电话……

品读时刻
2026-09-11 09:04:29
1.49亿债务曝光!古天乐发文,向华强说他快睡天桥,只是冰山一角

1.49亿债务曝光!古天乐发文,向华强说他快睡天桥,只是冰山一角

精彩一网打尽
2026-09-15 12:09:08
赛力斯大变天,震动行业!

赛力斯大变天,震动行业!

互联网品牌官
2026-09-15 16:58:48
2026-09-17 21:48:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9879文章数 568关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

退休副省长家中243万名酒被偷 管家获刑后举报其贪腐

头条要闻

退休副省长家中243万名酒被偷 管家获刑后举报其贪腐

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

猛士X700内饰公布 华为技术加持打造家庭泛越野智能座舱

态度原创

本地
艺术
旅游
房产
公开课

本地新闻

不止胖东来!许昌藏着半部三国史

艺术要闻

海因里希·伯默:德国写实风景画家

旅游要闻

瞰中国|山东临朐:山道揽秋光 山水蕴诗意

房产要闻

突发!三亚安居房出台新政!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版