网易首页 > 网易号 > 正文 申请入驻

当AI开始“失忆”,谁来给智能体装上长期记忆?

0
分享至



AI 如今要走向实际应用,能力已经不是最关键的掣肘,记忆才是。

以 AI 编程为例,主流工具的用户社区里,最常见的抱怨就是模型自动“压缩”引发的信息损伤。开发者花了两个小时才和 AI 助手建立起的默契,很可能在下一轮对话中就全盘崩坏。最后 Token 烧掉不少,工作效率反而被拖慢了。

随着大模型的推理能力不断升级、工具生态日益成熟,它越深入地嵌入我们的日常工作,一个过去少有人在意的课题反而变得越重要:AI 到底能不能拥有类似人脑的“记忆”?

行业如今正在向答案靠近。8 月 12 日,牛津大学、清华大学、北京大学等近 30 所机构学术团队联合发起的“记忆之巅排行榜”(AML)正式揭晓首期榜单。首期评测吸引 136 个团队参赛,官网点击量突破 20 万,上线后迅速跻身 Hugging Face 每周热门榜单前三。


(来源:Hugging Face)

在最受关注的商业产品文本赛道,综合排名第一的系统来自一家成立仅五个月的深圳公司,MemoraX AI(忆纪元)。它的总得分为 58.0,在文本记忆的全部七个能力维度上都居于首位。对照来看,在海外开发者社区拥有较高热度的开源项目 Mem0、MemPalace、Supermemory 则分别位列第 8、9、14 名。

当记忆逐渐成为 AI 的必修课,谁能交出最令用户满意的答卷?



记忆正在成为 AI 基础设施的独立环节

大模型的上下文窗口已经达到数百万 Token 量级,能装下更多对话,却依然难以真正记住用户的喜好和习惯。类似的问题也出现在多标签页切换、跨会话恢复等场景中:随着窗口扩大,AI 反而不那么好用了。

原因在于,把海量信息喂给模型后,AI 更容易在冗长且充满噪声的内容中产生幻觉。甚至反复踩坑、将用户的指令抛之脑后。要想让 AI 拥有长期记忆,就必须从底层让它想清楚“哪些应该记、哪些可以忘”,以及如何在合适的时机调用正确的记忆。

进入 2026 年,AI 应用开始从“单次问答”走向“长期陪伴”,在各个场景里,记忆能力都在成为越来越紧迫的优先事项。

具体来看,《麻省理工科技评论》2026 年“十大突破性技术”榜单(TR10)中,“AI 陪伴”与“生成式编码”分别占据一席。

前者要求 AI 在无数互动中稳定理解使用者的情感、过往偏好与习惯,后者同样要求 AI 能持续跟踪项目架构、代码风格与开发上下文,在长达数天乃至数月的项目周期中顺利辅助用户完成任务。

如果说这两项技术代表了 AI 走向长期协作的应用前台,Agent Memory 就是支撑这种协作得以持续的底层基础设施。

企业部署的 AI 应用与多位员工分别交互,从中沉淀业务规则。但行业调研显示,上下文丢失等记忆缺陷是企业 AI 应用未能规模化落地的主因之一。可穿戴设备、智能家居和具身智能等终端则将记忆的重要性推至决定产品生死的地位:没人想长期使用一款随时会遗忘用户习惯的 AI 产品。

在记忆环节,学术与开源社区已有进展。4 月,前 OpenAI 创始成员、现 Anthropic 预训练团队成员安德烈·卡帕西(Andrej Karpathy)在 GitHub 发布了一份名为“LLM Wiki”的构想文档,反思现有检索式记忆范式,并呼吁模型行业构建不断累积、可被自身更新的知识底座。主攻模型记忆的 Mem0,GitHub 已突破六万星标,是过去一年增长最快的 AI 底层开源项目之一。

云基础设施厂商也意识到了这一问题,陆续为其智能体开发平台装上记忆模块:AWS 的 Bedrock AgentCore 中,支持短期会话与跨会话长期记忆的 Memory 成为核心组件;微软 Azure 也开放了 AI Foundry Memory 模块。

行业整体动向共同指向一个趋势,记忆正从附属功能升级为 AI 的必备基础设施。不过,解决记忆问题的技术不止一种,谁的路线能最终跑通?



从“外挂检索”到“内生记忆”:三代技术路线的演进

回顾过去两年多的行业实践,可以按技术深度将其大致划分为三代。

第一代是向量检索式记忆,即当下最主流的检索增强生成(RAG)路线。技术原理在于,将历史信息切分成小块,分别转成向量后存入外挂数据库;对话触发后,系统按相似度检索出若干片段,拼接进提示词供模型参考。

这条路线的最大优势是工程门槛低、生态成熟,LangChain 等主流智能体框架都提供开箱即用的实现。局限也同样明显:该路线很难实现跨场景迁移,它的本质是“查字典”,模型无法真正理解片段之间的关系,不会主动遗忘过时的偏好,也不会根据新交互来更新判断。

第二代是结构化记忆,包括引入知识图谱、分层存储或“记忆操作系统”等架构。该路线将向量条目按实体、关系、时间等维度组织起来,与前代相比多了关系建模能力,也能对不同优先级的记忆做分层管理。

但它并未跳出“外挂”的框架,只是给 AI 搭建了更聪明的资料库:存储依然是静态的,检索依然是被动的,记忆系统依然不会从交互中自主进化。

第三代是内生记忆,这一路线彻底放弃了向量检索,试图让记忆成为模型的原生能力:通过强化学习进行端到端训练,让模型在前期训练和后续使用中学会记忆的写入、压缩、遗忘与调用。

三代之间的差异,本质上是“存储与检索”到“决策与学习”的范式迁移。前两代把记忆视为一个信息管理问题;第三代把记忆视为一个序列决策问题:AI 记忆能力的升级,取决于其能否被建模为一个可训练、可评估、可优化的学习系统。

落到评测层面,AML 首期榜单中,第一名与后位系统间超过十分的差距,很大程度上正源于不同模型在不同路径上演化的进度。



第一名背后,AI 如何学会“管理记忆”?

AML 将参评系统的参与限定在 Add(写入和更新记忆)与 Search(检索记忆),最终的 Answer(基于检索结果生成回答)和 Eval(评分)则由平台统一完成,从而在一定程度上减少回答模型、Prompt 和评分规则不同带来的干扰。

从整张商业榜单来看,各记忆模型公司的能力结构呈现出显著的差异与分化。其中,MemOS 在事实召回、多跳推理、时间推理和记忆治理上表现较好,这与其强调结构化、可编辑与自演化的技术路线相呼应。

网易 NTES-MEMORY-SMART 个性化能力高达 57 分,在用户意图与偏好理解方面具有优势。

综合评分排名靠前的 TencentDB Agent Memory、Mem0、SuperMemory 等框架则各有优劣,总体而言,高阶记忆管理能力还有提升空间。

而本次拿下榜单第一的 MemoraX ,其在事实召回、多跳组合、时间与事件、记忆治理、个性化、规则执行、安全与隐私七个维度中都取得最高分。


图 | 榜单前三名不同维度得分对比(来源:AML)

基于此,一个更值得深入讨论的问题是,这位“优等生”为何不偏科?原因在于,MemoraX 已经来到 AI 记忆路线的第三层:模型原生。实现了从强化学习、大模型后训练到记忆策略学习,再到长期记忆评测与工程化的技术链条闭环。围绕这一思路,MemoraX 目前形成三层技术体系。

第一层是可学习记忆策略引擎,传统记忆方案主要依靠人工规则、Prompt 或固定流程实现。但 MemoraX 希望借助强化学习,让模型在长期交互中自主完成记忆管理决策。

第二层是记忆基模。与直接调用通用大模型处理所有任务不同,MemoraX 将其定位为专门针对长期记忆任务训练的模型,处理超长上下文、时间关系以及记忆压缩等问题。

第三层则是自演进 Agent Harness,将实际应用产生的交互和反馈重新引入系统,让前面的记忆策略能够继续迭代。

总体而言,MemoraX 真正想改变的是模型记忆的底层逻辑:不只是堆信息量,更关键的是让 AI 自己决定“什么值得记”。

支撑这套技术体系的,是团队在产业落地与算法创新两方面的长期积累。MemoraX AI 的核心成员一部分曾是华为、阿里、腾讯等企业的大模型研发与 Agent 团队技术负责人,合作成果曾在芯片设计、游戏AI、推荐搜索等工业级场景大规模落地。

另一部分则是国内强化学习领域的头部研究力量,兼具学术与产业化经验。以团队的代表性工作 ReMix(ICLR 2026)为例,它支持在后训练中安全复用历史数据,解决了强化学习的数据浪费问题。在部分设置下,训练数据效率可提升 30 至 450 倍。这种能力实际上就可被迁移至模型的高阶记忆中。

围绕大模型后训练、Test-Time Scaling 等方向,团队与多所高校合作的 10 篇论文已被 ICML 2026 录用。相关工作曾获中国电子学会自然科学奖一等奖、中国图像图形学会科技进步奖一等奖。

AML 不是 MemoraX 交出的第一份考卷。更早之前,MemoraX 已在几个不同类型的记忆基准取得亮眼成绩:在南京大学与上海 AI Lab 联合发布的 LoCoMo-Refined 基准上拿到 82.65 分、领先第二名 30%;在与牛津大学联合开源的剧本记忆基准 ScriptMem 上正确率 60.3%、领先第二名 40%;在编程领域的 SWE-context-bench 上任务解决率 45%、领先第二名 50%。

如今,为推进 Agent Memory 愿景落地,MemoraX 正在快速推进商业化。2026 年 4 月,公司完成千万美元种子轮融资,5 月完成数千万元人民币种子+轮,8 月又宣布完成数亿元种子++轮。据悉,公司还与华为云签署战略合作,目前是后者合作厂商中唯一聚焦长期记忆的企业。

当然,Benchmark 测试的是特定规则和数据集下的表现,真正的验证必须在生产环境中进行。

应用场景方面,MemoraX 正在覆盖 Coding Agent、医疗健康、智能家居、智能穿戴和具身智能等方向。在AI Coding 领域,其产品试图让 Codex、Claude Code 等 Agent 持续理解项目上下文和历史开发经验。在慢病管理中,则需要持续理解用户状态;进入家庭和智能终端后,需要沉淀家庭成员习惯与设备偏好。

在产品路径上,公司将进入企业知识管理、智能客服等 B 端领域,同时在个性化智能助手以及交互式产品等 C 端应用也有布局。



AI 记忆,距离真正的基础设施还有多远?

长期来看,AML 榜单上展现出的性能,究竟能否在数月乃至数年的实际运行中维持,是整个 AI Memory 赛道需要面对的考验。

目前 Agent Memory 最成熟的评测仍集中在文本,MemoraX 也已经在图像记忆相关 Benchmark 上进行验证。但智能眼镜、耳机、家庭机器人等真正需要长期记忆的设备,收集的信息往往是包括视频、语音甚至高度不确定的现实环境等多种模态。

如何为时间、空间序列下的海量内容搭建稳定可用的记忆决策框架,将成为模型原生记忆领域最大的技术挑战之一。

而榜单覆盖的维度再全面,也只能衡量记忆系统在特定数据集与评测规则下的能力切片。进入生产环境后,平台面对的是更复杂的现实变量:成本、延迟、隐私权限、记忆存储时长,每一项都直接关乎用户信任和商业效益。更关键的是,作为一个长程系统,AI 记忆一旦出错,后果将随时间不断放大,记忆系统的迭代与纠错能力有时或许比“记住”更重要。

推理能力的竞赛已经白热化,而一个记不住上下文的 AI,终究只是“聪明的陌生人”。先让 AI 变成“靠谱老搭档”的公司,才有望在 AI 时代的下半场掌握先发优势。

参考资料:

https://agentmemoryleaderboard.ai/leaderboard/industry/textual

https://github.com/mem0ai/mem0

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
长沙“摸臀姐”,又惹了大麻烦!

长沙“摸臀姐”,又惹了大麻烦!

新动察
2026-09-11 10:24:31
普京终于等到这一天,泽连斯基松口准备让步,中国的机会来了?

普京终于等到这一天,泽连斯基松口准备让步,中国的机会来了?

薛小荣
2026-09-10 13:14:05
“出境将全面收紧,普通人出境变难”系误读新规(2026·09·10)

“出境将全面收紧,普通人出境变难”系误读新规(2026·09·10)

网络辟谣
2026-09-10 20:13:15
越扒越癫!熊某被扒了个底朝天:牵连厦门,央媒下场 退路彻底没了

越扒越癫!熊某被扒了个底朝天:牵连厦门,央媒下场 退路彻底没了

观察鉴娱
2026-09-11 11:18:15
生涯首进美网决赛!莱巴金娜2-1逆转高芙,将战萨巴伦卡争冠

生涯首进美网决赛!莱巴金娜2-1逆转高芙,将战萨巴伦卡争冠

全景体育V
2026-09-11 11:12:32
2027将会是中华人民共和国全党、全军、全国各族人民重要的一年

2027将会是中华人民共和国全党、全军、全国各族人民重要的一年

生活的哲学
2026-09-11 07:49:04
大学生被40多岁富婆包养后,爱上富婆想娶对方,2019年富婆将他分尸,不想让丈夫知道

大学生被40多岁富婆包养后,爱上富婆想娶对方,2019年富婆将他分尸,不想让丈夫知道

汉史趣闻
2026-09-10 14:48:13
“4岁男童被指摸臀”,男孩父亲最新发声:将进行反诉;不为索赔,只为给孩子要一个法律上的清白;胜诉赔偿全额捐给青少年公益

“4岁男童被指摸臀”,男孩父亲最新发声:将进行反诉;不为索赔,只为给孩子要一个法律上的清白;胜诉赔偿全额捐给青少年公益

都市快报橙柿互动
2026-09-11 14:03:52
王自如曝出神言论!在苹果折叠手机面前,国产折叠手机没得打

王自如曝出神言论!在苹果折叠手机面前,国产折叠手机没得打

小徐讲八卦
2026-09-10 14:59:46
长沙“摸臀姐”的麻烦要来了!

长沙“摸臀姐”的麻烦要来了!

麦杰逊
2026-09-11 08:00:12
学生不订奶被处罚,教室后面站成一排:蒙牛和他们有合作,武汉的所有中小学校都要订

学生不订奶被处罚,教室后面站成一排:蒙牛和他们有合作,武汉的所有中小学校都要订

江山挥笔
2026-09-11 08:19:59
事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

人生录
2026-09-11 00:05:21
875亿现金储备加持,理想汽车26.5亿加码电池产业链

875亿现金储备加持,理想汽车26.5亿加码电池产业链

道哥说车
2026-09-11 09:35:25
女子嫌丈夫无能出轨领导,岳父母劝女婿要大度,2016年女婿杀死他们3人

女子嫌丈夫无能出轨领导,岳父母劝女婿要大度,2016年女婿杀死他们3人

汉史趣闻
2026-09-11 10:32:07
那个被取消资助的大二女生:1500块,怎么在5年里变成了“我的钱”?

那个被取消资助的大二女生:1500块,怎么在5年里变成了“我的钱”?

热辣茉莉说
2026-09-11 00:23:36
这场臭气熏天的裸奔,辟谣后续来了!

这场臭气熏天的裸奔,辟谣后续来了!

胖胖说他不胖
2026-09-11 10:25:19
史上最强违停刷屏,交警发呆三分钟,网友:这罚单真没法贴

史上最强违停刷屏,交警发呆三分钟,网友:这罚单真没法贴

品读时刻
2026-09-11 09:04:43
复旦女硕士在意大利旅游被蜱虫叮咬染重症,严重时生活不能自理,家属全网求助:暂无特效药,希望找到擅长蜱传疾病的专家,寻求诊疗方案

复旦女硕士在意大利旅游被蜱虫叮咬染重症,严重时生活不能自理,家属全网求助:暂无特效药,希望找到擅长蜱传疾病的专家,寻求诊疗方案

鲁中晨报
2026-09-11 07:15:05
乌克兰抗议无效,中国通告全球正式出兵俄罗斯,千万颗地雷我们清

乌克兰抗议无效,中国通告全球正式出兵俄罗斯,千万颗地雷我们清

铁锤侃侃而谈
2026-09-11 01:16:48
“至今很后怕!赶不走打不得,大家都不敢动了……”浙江姑娘雨后爬山,遭遇剧毒烙铁头、眼镜蛇

“至今很后怕!赶不走打不得,大家都不敢动了……”浙江姑娘雨后爬山,遭遇剧毒烙铁头、眼镜蛇

都市快报橙柿互动
2026-09-11 01:10:42
2026-09-11 15:16:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17227文章数 515214关注度
往期回顾 全部

科技要闻

罗永浩连用7个“抄的”吐槽苹果折叠屏

头条要闻

小孩坠楼砸烂宝马定损5万 车主:家长要求拆车件维修

头条要闻

小孩坠楼砸烂宝马定损5万 车主:家长要求拆车件维修

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

17岁拿下世界第一,还被亲妈吐槽?

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

艺术
亲子
本地
公开课
军事航空

艺术要闻

“9.11”事件25周年,纽约用无人机再现世贸双塔

亲子要闻

幼儿园还没开学,媳妇要把女儿送新幼儿园,4岁女儿急的直磕头

本地新闻

拼假 13 天国内长线路线合集

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

涉伊朗核问题 中国和俄罗斯投下反对票

无障碍浏览 进入关怀版