网易首页 > 网易号 > 正文 申请入驻

NeurIPS 2026 | 别等Agent把任务搞砸!7B审计员AgentForesight在线抓错

0
分享至



从事后归因到在线审计,在任务失败前识别关键错误

多智能体的失误,未必表现为当场报错。更麻烦的是,一个 Agent 给出错误前提,其他 Agent 却继续认真执行。来自罗格斯大学、得克萨斯大学奥斯汀分校和普渡大学的研究团队提出 AgentForesight,让一个 7B 模型在任务运行中持续审计。在 AFTraj-2K 测试集上,它对失败轨迹的关键错误步骤识别指标Exact-F1 达到 66.44,比最强通用模型基线高19.88分,而对成功轨迹误报率仅为2.37%。

让一个 Agent 规划,一个 Agent 搜索,再让另一个 Agent 汇报,任务就一定更可靠吗?

设想这样一个场景:用户想买一副 200 美元以内的降噪耳机,筛选 Agent 却把预算上限设成了 300 美元。接下来,比较参数、生成报告、给出推荐,每一步都可能有条不紊。可再漂亮的报告,也掩盖不了整条工作流已经偏离了用户要求。

后面的 Agent 未必做错了自己的子任务。它们只是把前面那一步的错误,当成了继续工作的前提。

等推荐生成后,再追问「哪个 Agent、哪一步出了错」,当然有助于复盘。但能不能在预算刚被改错时就提醒系统,而不是让后面的 Agent 继续沿用这个错误前提?

这正是 AgentForesight 的出发点:在局部错误已经出现、却尚未一路传成任务失败时,尽早发出预警。

为此,它把事后归因前移为在线审计:每完成一步,外部审计员就读取截至此刻的执行记录,决定继续还是报警,为后续干预争取时间。



  • 论文标题:AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems
  • 作者:Boxuan Zhang、Jianing Zhu、Zeru Shi、Dongfang Liu、Ruixiang Tang。其中 Boxuan Zhang 与 Jianing Zhu 为共同第一作者,Ruixiang Tang 为通讯作者。
  • 机构:Rutgers University、The University of Texas at Austin、Purdue University。
  • 论文链接:https://arxiv.org/abs/2605.08715
  • 项目主页:https://zbox1005.github.io/agent-foresight/
  • 代码仓库:https://github.com/ZBox1005/AgentForesight
  • 数据集:https://huggingface.co/datasets/ZBox008003/AFTraj

还没看到结局,凭什么叫停?

过去,许多多智能体失败分析工作采用事后归因:先读完一条已知失败的轨迹,再判断责任 Agent 和关键错误步骤。后续错误如何扩散、最终答案为什么不对,都能成为定位线索。

在线审计没有这些「后见之明」。AgentForesight 只能看到当前轨迹前缀,也就是截至此刻已经发生的记录;未来的动作、尚未返回的工具结果和最终成败,都不在它的视野里。



图 1|从事后归因到在线审计。上图事后审计在任务失败后回溯错误;下图在线审计在关键错误出现时报警,为后续处理留下机会。

难点因此不只是「找出一个错误」,而是区分:系统尚在合理探索,还是已经出现影响任务成败的决定性错误?前者不应被无端打断,后者则应在被下游 Agent 继续沿用前尽早识别。

报警也不能只说一句「有问题」。审计员还要指出错误发生在哪一步、由哪个 Agent 引入,并给出简短理由,让后续处理有明确的着力点。

不只收集失败,还要知道什么时候该放行

把事后归因搬到线上,训练数据也得改变。只有失败轨迹,模型学不到何时应该继续任务;只有整条任务的成败标签,又无法告诉它究竟从哪一步开始出了问题。

为此,团队构建了 AFTraj-2K,覆盖代码生成、数学推理,以及涉及工具与检索的 Agentic 任务。数据集包含 2,272 条标注轨迹:1,158 条经过验证的成功轨迹,1,114 条失败轨迹。

但「最终答对」,并不等于「过程每一步都可靠」。中途出错后被其他 Agent 纠正的轨迹,不能不加区分地当作可用成功样本。团队因此同时检查最终结果、工具调用的完整有效性,以及每一步与当前子目标的一致性,筛出可用于前缀监督的成功轨迹。



图 2|决定性错误的位置分布。横轴为错误位置占轨迹长度的比例,三个任务域呈现不同分布;总体覆盖 1,114 条失败轨迹。关键错误并不固定出现在开头或结尾。

失败数据则来自两条路径:一条在验证过的成功轨迹上注入错误,检查修改是否生效、任务是否确实失败;另一条从自然失败中提出候选位置,再经多次独立验证,检查错误是否真实存在、是否实质影响任务、是否具有决定性,以及是否为最早的决定性错误。

这里要找的不是最显眼的异常,而是能改变任务结局的关键一步:修正它之后,是否存在让任务从失败转向成功的后续路径?这让标签从「整条任务失败了」,细化为「哪一步、哪个 Agent 引入了决定性错误」。

先学会识别失败边界,再把错误找准

有了步骤标签,为什么还要分阶段训练?因为通用模型面临两道相互关联的门槛:先分清当前记录是否已经越过失败边界,再在出错的记录里定位具体步骤和责任 Agent。

直接要求它一次学会全部能力,精确归因的奖励信号又过于稀疏,训练就可能退化成一律回答「安全」。AgentForesight 因此采用由粗到细的两阶段训练:先建立对失败边界的敏感性,再将这份风险判断细化为准确归因。



图 3|AgentForesight 方法总览。左:筛选成功轨迹,通过受控错误注入与自然失败验证构建步骤标注。右:先以 BPPO 学习失败边界,再以三轴奖励细化审计结论。

第一阶段:敏锐捕捉从「继续」到「报警」的关键转折

第一阶段的重点,是让在线审计模型对「还能继续」到「应该报警」的临界变化敏感起来。团队从同一条失败轨迹中取出两个相邻前缀:一个停在决定性错误前,应当继续;另一个只多出刚刚出错的那一步,应当报警。

这样,任务背景和此前的执行历史保持不变,判断却必须随着关键一步翻转。训练信号因此聚焦于导致风险变化的内容,而不是等失败后果充分暴露,才认出「这条任务已经失败」。

这就是边界对偏好优化(Boundary-Pair Preference Optimization,BPPO):在每个前缀下提高正确回答相对于错误回答的偏好,并联合学习边界两侧的样本。模型由此获得对失败临界点的风险预判先验,为下一阶段的精确定位提供起点。

第二阶段:从「有问题」,到「哪一步、哪个 Agent」

建立风险预判之后,还要让报警足够具体。第二阶段以第一阶段模型为起点,围绕审计结论的三个维度给出奖励。



步骤奖励不是只有「全对/全错」:预测位置越接近标注,奖励越高,为逐步找准错误提供平滑信号。误报与漏报都会受到惩罚,避免模型靠一律报警或一律放行取巧。

训练还将第一阶段模型作为 KL 约束的参照,限制第二阶段偏离已经学到的风险判断。两个阶段并非简单串联:后者要在保留失败边界敏感性的同时,把「这里不对劲」细化为「这一步、这个 Agent 出了问题」。

同样只看当前记录,7B 审计员表现如何?

团队在 AFTraj-2K 的 332 条留出测试轨迹上评估审计能力。AgentForesight 与表中通用模型都逐步读取前缀,并以首次报警中的判断计分。Exact-F1 同时考察关键错误的检出与精确定位,ASS 则衡量报告的错误位置平均偏离标注多少步。



表 1|AFTraj-2K 留出测试集主结果节选。↑越高越好,↓越低越好。

AgentForesight-7B 的 Exact-F1 达到66.44,比该指标上最强的通用基线 DeepSeek-V4-Pro高 19.88 分;相比其基础模型 Qwen2.5-7B-Instruct 的 21.05,提升也十分明显。

ASS 则从 DeepSeek-V4-Pro 的 1.77 降至 0.59,约为三分之一。这里衡量的是已检出失败轨迹上的归因位置偏差,而不是从出错到报警的等待时长。

分域来看,数学、代码与 Agentic 任务的 Exact-F1 分别为 77.36、78.87 和 48.70;Exact-F1 和 ASS 在三个域上都领先主表中的对照方法。

优势也不只出现在自建测试集。在未参与训练的外部 Who&When 基准上,AgentForesight-7B 的关键步骤与责任 Agent 识别准确率分别为 57.69% 和 73.08%,ASS 为 1.62,均为论文所列对比模型中的最佳结果。

两个阶段,究竟各自补上了什么?

消融实验给出了直接对照:基础模型的总体 Exact-F1 为 21.05,只用第一阶段 BPPO 训练为 35.63,只用第二阶段训练为 50.42,完整方案训练则达到 66.44。



图 4|两阶段训练的消融结果。完整方案在三个任务域及总体 Exact-F1 上均优于单独使用任一阶段;柱顶数字为四舍五入后的结果。

更能说明问题的是 Agentic 任务:只用第二阶段,Exact-F1 为19.05,低于只用第一阶段的31.58;两个阶段结合后,才提升到48.70。

这与两阶段的分工相呼应。数学和代码中的关键错误相对容易定位,定位奖励已能带来较好表现;而在检索、工具调用与多角色交互中,「是否已经构成决定性错误」更难判断,先建立失败边界的辨认能力就尤其重要。

对失败边界的判断,为更精确的错误归因提供起点。

这也解释了为什么不能只盯着 ASS:模型只在少数有把握的案例中报警,也可能得到很小的位置偏差。定位准不准,还要和漏掉了多少错误一起看。

抓得准之外,别把正常任务也叫停

在线审计的另一半考验,藏在成功轨迹里:它不是等任务结束后判断一次「成功」,而是要在每一个尚未完成的时刻,都不误把合理过程叫停。



图 5|成功轨迹误报率与失败轨迹步骤准确率的权衡,越靠左上越好。浅绿色区域为论文选定的分析参考范围:FAR 不超过 20%,Step Accuracy 不低于 50%。

AgentForesight-7B 的成功轨迹误报率 FAR 为 2.37%,失败轨迹上的 Step Accuracy 为 59.51%;DeepSeek-V4-Pro 对应为 43.20% 和 53.99%。

2.37% 是按整条轨迹计算的:169 条测试集成功轨迹中,只有 4 条在逐步审计时触发过误报。一条轨迹只要在任意前缀上报警一次,就计为误报,而不是用大量正常步骤把错误「平均掉」。

因此,这组结果不只是「更少报警」,而是低误报与较好的关键错误识别同时出现。审计员既要对风险保持敏感,也要给正常探索留下空间。

一个错误答案,如何变成多个 Agent 的「共识」?

论文中的一条地点问答轨迹,展示了这种风险。系统需要寻找 Rivington Hall Barn 附近的一座旧工业城镇;案例标注答案为 Bolton,搜索 Agent 却返回 Horwich,Manager 随后沿用这一结果,最终提交错误答案。



图 6|同一条问答轨迹中的不同判断。AgentForesight 将错误归因于 search_agent 返回错误地点的步骤;Gemini-3-Flash 指向较早的规划步骤,DeepSeek-V4-Pro 则给出 Safe。

两种基线失误恰好相反:Gemini-3-Flash 把仍在规划中的步骤判为决定性错误;DeepSeek-V4-Pro 则接受了这串前后自洽、却建立在错误事实上的执行过程。AgentForesight 指向搜索 Agent 返回错误地点的那一步,而非更早的正常规划。

后续 Agent 重复一个答案,并不会让它变成更可靠的证据。在线审计要区分的,正是「信息仍待补充」和「关键错误已经被当成依据」这两种看起来都能继续往下执行的状态。

Agent 的下一位队友,可能是独立审计员

AgentForesight 探索的是一种独立分工:执行 Agent 负责推进任务,外部审计员专门判断过程是否已经出现关键偏差。它不要求重新训练底层执行系统,执行能力与审计能力可以分别优化。

这样的审计结论,可以成为暂停、重新规划、切换执行路径或转交人工检查的依据。多 Agent 系统不必等任务结束,才第一次获得关于执行过程的反馈。

本项工作的实验重点仍是在线识别与归因。报警后采取什么动作、能挽救多少失败,以及是否提高最终任务成功率,需要与具体干预机制结合验证。

审计员本身也会出错:论文观察到,本可由验证 Agent 自行纠正的过程仍可能触发误报,已检出的错误也可能存在定位偏差。逐步审计会增加调用开销,在更长的工作流、具身和开放式科研任务中的表现,也有待进一步评估。

这项工作的启示是,提升多智能体的可靠性,不一定只靠更强的执行模型,也可以让一个专门训练的模型,在运行过程中识别并指出关键错误。

多 Agent 协作,不只需要会执行的队友,也需要知道何时该提醒「这一步不对」的审计员。

作者信息

张博轩,罗格斯大学(Rutgers University)计算机科学博士生,师从唐瑞祥教授。研究方向包括可信智能体、大语言模型后训练与生成内容检测,相关成果发表于 NeurIPS、ACL、IJCV 等国际会议与期刊。目前重点关注智能体的在线审计、失败预警与可靠性评估,致力于提升大语言模型智能体在复杂任务中的安全性与可靠性。

个人主页:https://zbox1005.github.io/

实验室主页:https://www.ruixiangtang.net/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
对话 8 位汽车工程师和学者:上世纪成熟的踏板,为何今天还会断裂?

对话 8 位汽车工程师和学者:上世纪成熟的踏板,为何今天还会断裂?

晚点LatePost
2026-10-10 00:36:29
尊界制动踏板支架断裂后,岚图、本田、仰望等多家车企高管晒自家刹车部件

尊界制动踏板支架断裂后,岚图、本田、仰望等多家车企高管晒自家刹车部件

澎湃新闻
2026-10-10 10:54:30
乐道首战告捷:两年、20万台与23.4万均价

乐道首战告捷:两年、20万台与23.4万均价

36氪
2026-10-08 17:11:47
普京与特朗普通话,“没人愿意先挂电话”!除了战争、柴油,他们还热聊了啥

普京与特朗普通话,“没人愿意先挂电话”!除了战争、柴油,他们还热聊了啥

红星新闻
2026-10-10 14:04:09
懂车帝全网下架,事情彻底闹大了!

懂车帝全网下架,事情彻底闹大了!

财经三分钟pro
2026-10-10 10:18:34
33岁男子在台湾花莲街头持西瓜刀随机挥砍路人,一名女游客头发被削断,其被捕后竟称心情差“想博眼球”

33岁男子在台湾花莲街头持西瓜刀随机挥砍路人,一名女游客头发被削断,其被捕后竟称心情差“想博眼球”

南方都市报
2026-10-10 16:59:39
出轨9人的女局长,大概率不仅有作风问题!

出轨9人的女局长,大概率不仅有作风问题!

仕道
2026-10-10 08:58:14
大满贯女单决赛今日出炉,如果王曼昱击败张本美和,将有4大利好

大满贯女单决赛今日出炉,如果王曼昱击败张本美和,将有4大利好

南海浪花
2026-10-10 06:32:28
央视曝光!20余省100多家A级景区被摘牌,昔日金字招牌割不动了

央视曝光!20余省100多家A级景区被摘牌,昔日金字招牌割不动了

财经八卦
2026-10-09 18:17:58
警方通报国乒男队主教练王皓被围堵辱骂:杨某某(女,19岁)、李某(女,19岁)、陶某某(女,16岁)被行政拘留,其他17人被批评教育

警方通报国乒男队主教练王皓被围堵辱骂:杨某某(女,19岁)、李某(女,19岁)、陶某某(女,16岁)被行政拘留,其他17人被批评教育

极目新闻
2026-10-10 10:48:44
CCTV5直播!赵松源领衔最强U17国足,首秀对阵世界第一,胜率或不超10%

CCTV5直播!赵松源领衔最强U17国足,首秀对阵世界第一,胜率或不超10%

篮球圈里的那些事
2026-10-10 14:13:32
金价大降后又涨,金店导购称国庆期间生意火爆:浙江女子花99000元买100多克黄金送父母,有顾客给准儿媳买十金

金价大降后又涨,金店导购称国庆期间生意火爆:浙江女子花99000元买100多克黄金送父母,有顾客给准儿媳买十金

大风新闻
2026-10-10 15:41:07
马化腾和姚顺雨同框,传递了什么信号?

马化腾和姚顺雨同框,传递了什么信号?

澎湃新闻
2026-10-10 13:52:27
湖南永州“女局长出轨多人”举报者再发声 当地已成立联合调查组展开核查

湖南永州“女局长出轨多人”举报者再发声 当地已成立联合调查组展开核查

封面新闻
2026-10-10 15:17:03
特朗普新任白宫新闻秘书:曾在北京工作3年,任职中国知名律所,会讲普通话

特朗普新任白宫新闻秘书:曾在北京工作3年,任职中国知名律所,会讲普通话

红星新闻
2026-10-10 12:19:33
湖南永州通报“商务局周某某相关举报”:成立调查组

湖南永州通报“商务局周某某相关举报”:成立调查组

界面新闻
2026-10-09 18:52:06
悲催!东莞一玩具厂产能迁广西,保留原厂规避补偿,8年老员工只拿到2个月离职补偿承诺,双方陷入拉锯战

悲催!东莞一玩具厂产能迁广西,保留原厂规避补偿,8年老员工只拿到2个月离职补偿承诺,双方陷入拉锯战

火山詩话
2026-10-10 06:14:51
调整!中网官宣:郑钦文冲决赛时间有变,有利有弊,CCTV5直播!

调整!中网官宣:郑钦文冲决赛时间有变,有利有弊,CCTV5直播!

大秦壁虎白话体育
2026-10-09 20:11:49
一场2-0,中网首个决赛诞生!收获410万奖金,郑钦文迎1个好消息

一场2-0,中网首个决赛诞生!收获410万奖金,郑钦文迎1个好消息

侃球熊弟
2026-10-10 16:25:26
给具身智能换个「因果」内核,Aether AI的愿景终于走进物理世界

给具身智能换个「因果」内核,Aether AI的愿景终于走进物理世界

机器之心Pro
2026-10-09 14:39:01
2026-10-10 17:47:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14168文章数 142748关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

女局长被指出轨多人 同意给前夫500万考虑影响写330万

头条要闻

女局长被指出轨多人 同意给前夫500万考虑影响写330万

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

宋佳一串三大满贯 争议随之而来

财经要闻

蹭尊界流量?岚图汽车在“玩火”

汽车要闻

二十载再越巅峰 第五代全新别克君越今日正式上市

态度原创

时尚
房产
亲子
手机
家居

当Nicolas Ghesquièr的“未来主义”学会了呼吸

房产要闻

475万人,猛增13.1%!国庆海南,又爆了?

亲子要闻

医院曝光新毒物!多个厂家投毒,坑害婴幼儿,江浙沪已沦为重灾区

手机要闻

媒体称苹果iPhone Duo加单30%,总量仍未超过1000万台

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版