![]()
86%。
这是Google DeepMind研究员做攻击测试得到的数字:把一段恶意内容藏在普通网页里,AI Agent在86%的场景下会被部分控制,按攻击者的意图行动。如果换成记忆投毒攻击,只需污染不到0.1%的数据,成功率就能超过80%。
你的AI Agent正在帮用户读邮件、查文件、执行交易。它每天访问数十个网站、调用数十个API,记忆里存着用户的偏好、行为习惯、甚至账户信息。现在告诉你,上面那些攻击向量是真实存在的,有论文验证过的,有代码可以复现的。
这不是科幻小说,是2026年3月8日挂上SSRN的一篇论文。
过去两年,AI Agent圈子的叙事主要集中在"能做什么":能不能自主写代码?能不能操控浏览器?能不能完成多步任务?基准分数一路飙升,每隔几周就有新的SOTA出来。
这批Q1论文的气质明显不同。
MIT的研究从数学角度证明多Agent规划存在根本性上限;DeepMind系统梳理了六类可以劫持Agent的攻击手段;两篇论文聚焦记忆模块的工程化标准;还有一篇来自清华和哈工大的研究,连Agent的"脚手架"(harness)都想用自然语言来写。这批论文的共同主题,是边界:能力的边界、安全的边界、工程设计的边界。
这意味着AI Agent研究正在进入第二阶段。从"能不能做"到"能做到什么程度、怎么做才安全、怎么做才稳定"。对于正在或准备部署Agent的团队来说,这批论文的价值远比能力跑分型论文更直接。
本文,王吉伟频道梳理了10篇值得重点关注的AI Agent相关论文。这10篇的发布时间高度集中,涉及安全攻击、多智能体协调、长上下文处理、记忆模块、自主演化和隐私风险六大方向。把它们放在一起读,你会看到一张完整的AI Agent研究地图:既有能力的天花板,也有攻击的地下室。
以下按主题分类,逐篇拆解。
PS:10篇论文已打包,需要的兄弟们,公众号主页发送消息:260408,或缺全部论文资源。
安全红线:你的Agent已经是攻击目标 论文1:AI Agent Traps(Google DeepMind)
![]()
论文名称:AI Agent Traps,作者Matija Franklin、Nenad Tomašev等DeepMind研究员,2026年3月8日挂出。
论文链接:https://papers.ssrn.com/sol3/papers.cfm?abstract_id=6372438。
这篇论文做的事情,说简单也简单:把"互联网如何攻击AI Agent"系统地分了个类。说重要也重要:这是学术界第一个针对AI Agent攻击面的完整分类框架。
DeepMind把攻击手段分为六大类型,逐一来看。
内容注入(Content Injection),最直接,就是把恶意指令藏在网页的正常内容里,白底白字的隐藏文本、图片的alt属性、PDF的注释层,Agent在处理这些内容时会把恶意指令当成正常上下文执行。测试结果是86%的控制成功率,这个数字已经足够让任何安全团队坐不住。
语义操控(Semantic Manipulation),是更高明的一种:不直接注入指令,而是操控Agent的理解框架,让它对同一个事件产生错误判断。比如伪造新闻、构造虚假情境来误导Agent的决策链。
认知状态陷阱(Cognitive State Traps),专门针对Agent的规划和推理模块。通过制造矛盾信息或边界情境,让Agent陷入无限循环、过早终止,或跳过关键验证步骤。
行为控制陷阱(Behavioural Control Traps),这类攻击的实战测试结果最令人不安:在微软M365 Copilot上,测试者对10次数据外泄攻击实现了10/10的成功率。
系统性陷阱(Systemic Traps),针对的是多Agent协作系统的整体架构,比如通过让一个Agent"感染"另一个、利用共享记忆传播恶意内容。
人机协作陷阱(Human-in-the-Loop Traps),专门针对那些保留了人类审批节点的系统,通过制造紧迫感、伪造权威来绕过人类监督。
论文还指出了一个非常现实的法律困境:当被劫持的Agent实施了金融欺诈,谁来负责?是Agent运营商?模型提供商?还是域名持有人?现有法律框架没有明确答案。
OpenAI在2025年12月曾经承认,提示注入这类攻击"不太可能被完全解决"。DeepMind这篇论文某种程度上是对这句话的补充:它不仅是无法被完全解决的,而且攻击面比我们想象的宽得多。
这篇论文最大的价值不是给出了解决方案,而是给出了问题的完整清单,对于产品经理和安全架构师来说,这张清单就是你的必读检查表。
论文2:AgentSocialBench
![]()
论文名称:AgentSocialBench: Evaluating Privacy Risks in Human-Centered Agentic Social Networks,作者Prince Zizhuang Wang, Shuli Jiang,2026年4月1日发布。
论文链接:https://arxiv.org/abs/2604.01487,。
如果说AI Agent Traps描述的是单个Agent被外部攻击,AgentSocialBench要警告的是另一个维度的风险:多个Agent构成"社交网络"后,隐私泄露是如何系统性地发生的。
这篇论文构建了第一个针对"以人为中心的Agentic社交网络"的隐私风险基准,涵盖七类现实场景,包括个人助理Agent之间的通信协作、跨用户的任务委托、代理医疗信息共享等。
核心发现是两个概念,值得记住。第一个叫持久泄漏压力(Persistent Leakage Pressure):Agent在协作过程中必须跨域传递上下文,而这些上下文不可避免地携带用户信息。即使设置了访问控制,信息依然会通过侧信道,比如Agent的行为模式、任务描述、工具调用序列——被推断出来。
第二个叫抽象悖论(Abstraction Paradox)。你觉得给Agent加一条"保护用户隐私"的系统提示就够了?实验数据告诉你:在某些场景下,明确要求保护隐私的Agent,反而比没有这条指令的Agent泄露了更多敏感信息。原因是这条指令让Agent在协作中更主动地"澄清"和"确认"信息,反而促成了更多信息交换。
这个发现非常反直觉,也非常重要。当前主流的Agent隐私保护方案,基本上都在提示工程层面做文章,而AgentSocialBench的结论是:这条路走不通,必须在架构层面引入内存隔离和审计机制。面向C端或企业客户的AI Agent产品团队,这篇论文的结论需要尽早纳入产品规划。
理论边界:多Agent系统的上限在哪里 论文3:On the Reliability Limits of LLM-Based Multi-Agent Planning(MIT)
![]()
论文名称:On the Reliability Limits of LLM-Based Multi-Agent Planning,作者Ruicheng Ao、Siyang Gao、David Simchi-Levi,2026年3月27日发布。
论文链接:https://arxiv.org/abs/2603.26993
这篇论文做了一件大家都在回避的事:用数学证明多Agent系统的理论上限。
MIT的研究者把LLM Multi-Agent架构建模为"有限无环委托决策网络"(Finite Acyclic Delegation Network)。模型很简洁:多个Agent处理共享的上下文信息,通过有限容量的语言接口互相通信,逐步传递任务和结论。
核心定理是这样的:在没有引入新的外生信息的前提下,任何委托网络的决策质量都不可能超过一个"观察了相同信息的集中式贝叶斯决策者"。通俗地说,如果你手里的信息就是这些,不管拆成多少个Agent来讨论,最终的决策质量上限是固定的。差距用"期望后验散度"(Expected Posterior Divergence)来度量,它正比于通信过程中的信息压缩损耗。
更关键的推论:只有当工具调用或推理步骤引入了真正新的外生信号(比如调用了一个数据库查询、执行了一段代码得到实际输出),多Agent协作才能超越单Agent的理论上限。如果Agent们只是在互相"讨论"和"分析"已有信息,那么追加更多Agent、更多轮次的讨论,在理论上是没有帮助的。
王吉伟频道认为,这个结论对当前很多Multi-Agent产品设计有直接的指导意义。现在市面上大量的多Agent框架,核心设计是"让多个Agent互相讨论、互相验证、互相纠错",而MIT的这个定理告诉你:这种设计如果没有伴随真正新信息的引入,就只是在消耗token,并不能提升决策质量。
真正有价值的多Agent设计,是让每个Agent负责一个独立的信息采集或计算节点,而不是让它们在同一份材料上反复推理。
论文4:Self-Organizing LLM Agents
![]()
论文名称:Drop the Hierarchy and Roles: How Self-Organizing LLM Agents Outperform Designed Structures,作者Victoria Dochkina,2026年3月28日发布。
论文链接:https://arxiv.org/abs/2603.28990。
如果说MIT的论文是泼冷水,这篇论文则给出了一个有趣的反向实验结果:在多Agent系统中,不要替Agent规划好角色,让它们自己决定。
研究者做了一个极其系统的实验:25,000个任务、8个不同的LLM模型、最多256个Agent并发、8种不同的协调协议。这个规模在多Agent研究中算是相当扎实的。
八种协调协议覆盖了从完全集中式到完全自主式的全谱系。结果最好的不是任何一个极端,而是"混合协议"(Sequential):执行顺序固定,但每个Agent自主选择自己承担的角色。这个设计比纯集中式(系统预分配角色)高出14%(p<0.001),比纯自主式(连顺序都自己决定)高出44%(Cohen's d=1.86,p<0.0001)。
更让人惊讶的是涌现现象:从8个初始Agent出发,系统自发涌现出了5,006个独特角色。不是预设的,是Agent们在任务执行过程中自己"发明"出来的,构成了浅层的自适应层次结构,而不是传统的固定组织图。
另一个发现:模型能力越强,自组织效果越好。这意味着自组织这条路随着模型迭代会持续受益,不是一个边际收益递减的方向。
这两篇放在一起读,结论并不矛盾。MIT的论文说的是"相同信息下多Agent没有理论优势",这篇论文说的是"让Agent自主组织比预设结构更能激发能力"。本质上,自组织带来的优势恰恰来自于更好地利用了每个Agent的专长,减少了协调过程中的信息损耗——这和MIT的框架是一致的。
编码Agent的工程化:三条技术路线
2026年Q1有三篇论文专门聚焦编码场景,分别从协作策略、上下文处理和框架标准化三个角度提出了不同的工程思路。
论文5:Asynchronous Software Engineering Agents(CMU)
![]()
论文名称:Effective Strategies for Asynchronous Software Engineering Agents,作者Jiayi Geng, Graham Neubig,2026年3月21日发布。
论文链接:https://arxiv.org/abs/2603.21489。
CMU的这篇论文提出了一个叫CAID(Centralized Asynchronous Isolated Delegation)的框架,核心思路来自人类开发团队的协作模式:多个开发者同时在不同分支上工作,最后合并。
CAID把这个思路直接映射到多个编码Agent的协作上,用git的branch-and-merge机制实现隔离工作区和结构化集成。每个Agent在自己的分支里独立工作,不会互相干扰,完成后由协调者负责合并和冲突解决。
结果:在论文复现任务(PaperBench)上比单Agent基线提升26.7%,在Python库开发任务(Commit0)上提升14.3%。这两个数字都是绝对提升,不是相对提升,含金量不低。
有一个值得关注的发现:并行Agent数量和性能之间的关系不是线性的。从2个扩展到4个Agent时提升明显,但继续扩展到8个,性能反而开始下滑。
原因在于,任务拆分的精确度(也就是"委托质量")是决定协调成败的关键变量,当Agent数量过多时,任务拆分和合并的复杂度会超过并行化带来的收益。盲目扩展Agent数量不是正确方向,精细化的任务分解和清晰的接口设计才是。
论文6:Coding Agents as Long-Context Processors
![]()
论文名称:Coding Agents are Effective Long-Context Processors,作者Weili Cao, Xunjian Yin, Bhuwan Dhingra, Shuyan Zhou,2026年3月20日发布。
论文链接:https://arxiv.org/abs/2603.20432。
这篇论文提出了一个挺有意思的视角:与其让模型自身支持更长的上下文窗口,不如让Agent用文件系统和代码工具来"外部化"长上下文处理。
具体来说,就是让编码Agent在本地文件系统中组织和管理文本,通过执行代码和终端命令动态过滤、排序、转换数据,而不是依赖模型的注意力机制来同时处理所有信息。测试场景覆盖长上下文推理、RAG和开放域问答,语料库规模最高可达3万亿token,在多个基准上平均比现有SOTA的长上下文方法高出17.3%。
更重要的是它的工程含义:上下文窗口扩展是一个成本极高的方向,每次扩展都涉及大量重新训练和推理成本。而让Agent学会"像程序员一样管理文件",本质上是在模型之外建立了一套无限可扩展的上下文管理基础设施。这不需要改变模型,只需要改变Agent的工具使用策略。
论文7:Natural-Language Agent Harnesses(清华 & 哈工大)
![]()
论文名称:Natural-Language Agent Harnesses,作者Linyue Pan, Lexiao Zou, Shuo Guo, Jingchen Ni, Hai-Tao Zheng,2026年3月25日发布。
论文链接:https://arxiv.org/abs/2603.25723。
Harness(脚手架)是AI Agent系统里一个经常被忽视的组成部分。它控制着Agent如何接收输入、如何调用工具、如何处理输出、在什么条件下移交给下一个Agent。简而言之,harness是Agent系统的"结缔组织"。
问题是,当前的harness基本上都是硬编码在控制器代码里的——换个平台要重写,换个任务要重写,想做A/B测试也很麻烦,更谈不上版本控制和可解释性。
清华和哈工大的这篇论文提出Natural-Language Agent Harnesses(NLAHs):把harness的行为规范用自然语言来写,配合一个叫Intelligent Harness Runtime(IHR)的执行层来实现。
评测结果有一个值得关注的数据点:在SWE-bench Verified和OSWorld这两个基准上,90%的token消耗和工具调用都发生在被委托的子Agent中,而不是顶层协调器,说明harness层的设计直接影响系统的计算分配效率。
用自然语言写harness,意味着产品经理可以直接参与Agent行为的规范化,而不必依赖工程师修改代码。它还意味着harness可以被版本控制、被搜索、被跨系统复用。这个方向的长期价值很可能超过论文本身的技术贡献。
记忆基建:AI Agent最被低估的技术债
AI Agent有三块公认的短板:规划能力、工具使用稳定性、记忆管理。前两块得到了大量关注,记忆模块长期处于边缘地带。2026年Q1有两篇论文正面回应了这个问题。
论文8:MemFactory
![]()
论文名称:MemFactory: Unified Inference & Training Framework for Agent Memory,作者Ziliang Guo, Ziheng Li, Bo Tang, Feiyu Xiong, Zhiyu Li,2026年3月29日发布。
论文链接:https://arxiv.org/abs/2603.29493。
MemFactory是目前第一个专为记忆增强AI Agent设计的统一训练与推理框架。它的设计哲学是"乐高式"(Lego-like):把记忆生命周期拆解成原子化的可插拔组件,每个组件对应记忆的一个操作:编码、存储、检索、遗忘、更新,可以自由组合,也可以替换其中某个环节而不影响整体流水线。
更重要的是,MemFactory原生集成了Group Relative Policy Optimization(GRPO)来微调内部的记忆管理策略。这意味着记忆模块本身是可以被强化学习训练的,而不只是一个静态的存储结构。框架已经支持Memory-R1、RMM、MemAgent等当前主流的记忆增强方法,与基线相比可以获得最高14.8%的相对性能提升。
这个数字看起来不大,但要注意背景:记忆模块的改进是叠加在已有Agent能力之上的,在记忆密集型任务上,实际提升幅度会更高。
MemFactory解决的核心问题是:当前各家的记忆方案高度碎片化,互不兼容,缺乏统一的基础设施来做集成、训练和评估比较。这个框架是在建立标准,不只是在刷分。
论文9:Omni-SimpleMem
![]()
论文名称:Omni-SimpleMem: Autoresearch-Guided Discovery of Lifelong Multimodal Agent Memory,作者Jiaqi Liu, Zipeng Ling, Shi Qiu, Yanqing Liu等,2026年4月1日发布。
论文链接:https://arxiv.org/abs/2604.01007。
GitHub代码库:https://github.com/aiming-lab/SimpleMem。
如果说MemFactory是在工程化已有的记忆方法,Omni-SimpleMem做的事情则更激进:让Agent自己来设计记忆系统。
具体流程是这样的:研究者给出一个"朴素基线"记忆架构,然后启动一个自主研究管道(autoresearch pipeline)。这个管道会自动提出改进假设、设计实验、执行代码、分析结果、提炼新的改进方向,如此循环迭代,全程无需人工干预,总计执行了约50次独立实验。
结果非常显著:在LoCoMo长对话基准上,F1得分从0.117提升到0.598,提升幅度411%;在Mem-Gallery多模态记忆基准上,F1从0.254提升到0.797,提升幅度214%。
最有意思的不是最终数字,而是提升的来源分析。对最终性能贡献最大的三类改进分别是:Bug修复(+175%)、架构改动(+44%)、提示工程(+188%)。反而是传统AutoML最擅长的超参数调优,贡献最小。
这个发现对AI for Science和自主研究Agent的整个方向都有深远影响:真正重要的改进往往不在连续优化空间里,而在离散的架构决策中。这些离散决策需要像人类研究员一样"思考和实验",不是用贝叶斯优化搜出来的。
Omni-SimpleMem同时支持文本、图像、音频、视频四种模态,定位是"即插即用"的终身记忆模块,对于正在构建多模态Agent的团队,是一个值得关注的现成组件。
自主演化:AI Agent研究的最前沿 论文10:CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery(MIT & NUS)
![]()
论文名称:CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery,作者Ao Qu, Han Zheng, Zijian Zhou, Yihao Yan等,2026年4月1日发布。
论文链接:https://arxiv.org/abs/2604.01658。
GitHub:https://github.com/Human-Agent-Society/CORAL。
这篇论文可以说是这批10篇中最激进的一篇,也是距离"AI自主科研"这个命题最近的一篇。
CORAL的核心设计是:不预设Agent的角色、工具和工作流,让多个长时间运行的Agent在开放环境中自主演化,通过共享持久化记忆来积累经验,通过异步执行来并行探索,通过心跳干预"heartbeat intervention)机制来处理长时间任务中的状态检查和方向调整。
测试场景覆盖数学定理证明、算法优化、GPU内核工程等开放式任务。结果:在10项任务上创造了新的SOTA,比固定演化基线的改进率高3到10倍。具体到Anthropic的GPU内核工程基准:4个协作演化的Agent将最优分数从1363 cycles改进到1103 cycles,这不是排行榜上的微小进步,是有实际工程意义的幅度。
论文的一个重要贡献是把"安全保障"纳入了设计。CORAL提供了隔离工作区、评估器分离、沙箱执行等机制,避免演化过程中的Agent行为越界。这一点是当前很多自主科研Agent方向的研究容易忽略的:让Agent自由演化,不等于不需要边界。
在王吉伟频道看来,CORAL和Omni-SimpleMem放在一起,共同指向了一个值得持续关注的方向:AI Agent开始接管科研工作流本身,而不仅仅是科研工作中的某个步骤。这是一个质变,不是量变。
十篇论文整体拼图
把这10篇并排放在一起,它们描述的是AI Agent研究在2026年Q1的一个集体认知跃迁。用一个简单的框架来整理:
能力层,CAID、长上下文处理和CORAL分别在协作编码、上下文管理和自主演化上给出了具体的工程突破。
基础设施层,MemFactory提供了工程化的记忆框架,Omni-SimpleMem用自主研究管道推动了记忆架构的边界,NLAHs提出了harness的自然语言化。
边界层,MIT的可靠性极限从理论上划定了多Agent规划的上限,自组织论文证明了角色自主选择优于预设分配,同时也揭示了协调开销的规律。
风险层,AI Agent Traps系统梳理了来自开放互联网的六类攻击向量,AgentSocialBench揭示了多Agent社交网络中持续存在的隐私风险。
这四层并非相互独立,而是深度耦合的。能力越强,攻击面越大;架构越复杂,隐私风险越高;基础设施越标准化,边界才越清晰可控。
用一句话总结这十篇论文的共同信号:AI Agent正在从实验室走向生产环境,而生产环境意味着你必须同时回答"能做到什么"和"会出什么问题"这两个问题。只盯着前者,会在后者上翻车。
对从业者的实践建议
结合这批论文,这里我梳理了几条直接可用的行动建议。
对AI Agent产品负责人:AI Agent Traps和AgentSocialBench是必读内容,而且应该在产品上线前读,不是上线后。六类攻击手段和"抽象悖论"这两个概念,应该直接进入产品风险清单。提示工程级别的隐私保护是不够的,架构层的隔离机制需要提前规划。
对多Agent架构设计者:MIT的可靠性极限论文是认知框架,自组织论文是设计思路。两篇放在一起的核心结论是:让每个Agent有真正独立的信息获取职责,同时给它足够的自主空间选择执行方式。"更多Agent"不等于"更强系统",关键是每个Agent是否在引入新的信息。
对编码Agent的工程团队:CAID的git分支协作模型和长上下文外部化方案,是两个可以立即在工程上参考的思路。NLAHs的自然语言harness,值得在下一个Agent项目里做一次原型验证,harness的可迁移性和可解释性是被长期低估的工程价值。
对记忆模块的研究者和开发者:MemFactory和Omni-SimpleMem的代码库都已开源,都可以作为基础设施直接集成。Omni-SimpleMem的自主研究管道设计本身,也是一个值得借鉴的研究方法论:Bug修复和架构改动的贡献远超超参数调优,这个结论应该改变你的优化优先级排序。
结语
这10篇论文的发布时间,最早是2026年3月8日,最晚是2026年4月2日,前后不到一个月。这种密度在AI Agent研究领域并不罕见,但这次的主题集中度值得记录:安全、边界、工程化、记忆、自主演化,五个方向在同一个时间窗口里同步推进。
AI Agent已经不再是未来的技术,它现在是需要认真对待的工程现实。能力可以继续讨论,但攻击面和理论上限,是现在就要理解的东西。
这批论文是一个信号:学术界已经在认真讨论AI Agent的边界和风险了。产业界如果还只盯着能力跑分,会慢很多拍。
看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,也可以给个星标,你的支持就是我的动力。
全文完
【文末福利1】:后台发消息研报2026,获取15篇2026年AI Agent研报。
![]()
【文末福利2】: 后台发消息Workflow,获取 Agentic Workflow 相关25篇论文。
![]()
【文末福利3】:后 台发消息agentic,获取Agentic AI相关资源 。
![]()
【文末福利4】:后台发消息RPA Agent,获取 相关论文和研报。
![]()
1、
2、
3、
4、
5、
6、
7、
8、
8、
10、
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.