网易首页 > 网易号 > 正文 申请入驻

当AI开始“失忆”,谁来给智能体装上长期记忆?

0
分享至



AI 如今要走向实际应用,能力已经不是最关键的掣肘,记忆才是。

以 AI 编程为例,主流工具的用户社区里,最常见的抱怨就是模型自动“压缩”引发的信息损伤。开发者花了两个小时才和 AI 助手建立起的默契,很可能在下一轮对话中就全盘崩坏。最后 Token 烧掉不少,工作效率反而被拖慢了。

随着大模型的推理能力不断升级、工具生态日益成熟,它越深入地嵌入我们的日常工作,一个过去少有人在意的课题反而变得越重要:AI 到底能不能拥有类似人脑的“记忆”?

行业如今正在向答案靠近。8 月 12 日,牛津大学、清华大学、北京大学等近 30 所机构学术团队联合发起的“记忆之巅排行榜”(AML)正式揭晓首期榜单。首期评测吸引 136 个团队参赛,官网点击量突破 20 万,上线后迅速跻身 Hugging Face 每周热门榜单前三。


(来源:Hugging Face)

在最受关注的商业产品文本赛道,综合排名第一的系统来自一家成立仅五个月的深圳公司,MemoraX AI(忆纪元)。它的总得分为 58.0,在文本记忆的全部七个能力维度上都居于首位。对照来看,在海外开发者社区拥有较高热度的开源项目 Mem0、MemPalace、Supermemory 则分别位列第 8、9、14 名。

当记忆逐渐成为 AI 的必修课,谁能交出最令用户满意的答卷?



记忆正在成为 AI 基础设施的独立环节

大模型的上下文窗口已经达到数百万 Token 量级,能装下更多对话,却依然难以真正记住用户的喜好和习惯。类似的问题也出现在多标签页切换、跨会话恢复等场景中:随着窗口扩大,AI 反而不那么好用了。

原因在于,把海量信息喂给模型后,AI 更容易在冗长且充满噪声的内容中产生幻觉。甚至反复踩坑、将用户的指令抛之脑后。要想让 AI 拥有长期记忆,就必须从底层让它想清楚“哪些应该记、哪些可以忘”,以及如何在合适的时机调用正确的记忆。

进入 2026 年,AI 应用开始从“单次问答”走向“长期陪伴”,在各个场景里,记忆能力都在成为越来越紧迫的优先事项。

具体来看,《麻省理工科技评论》2026 年“十大突破性技术”榜单(TR10)中,“AI 陪伴”与“生成式编码”分别占据一席。

前者要求 AI 在无数互动中稳定理解使用者的情感、过往偏好与习惯,后者同样要求 AI 能持续跟踪项目架构、代码风格与开发上下文,在长达数天乃至数月的项目周期中顺利辅助用户完成任务。

如果说这两项技术代表了 AI 走向长期协作的应用前台,Agent Memory 就是支撑这种协作得以持续的底层基础设施。

企业部署的 AI 应用与多位员工分别交互,从中沉淀业务规则。但行业调研显示,上下文丢失等记忆缺陷是企业 AI 应用未能规模化落地的主因之一。可穿戴设备、智能家居和具身智能等终端则将记忆的重要性推至决定产品生死的地位:没人想长期使用一款随时会遗忘用户习惯的 AI 产品。

在记忆环节,学术与开源社区已有进展。4 月,前 OpenAI 创始成员、现 Anthropic 预训练团队成员安德烈·卡帕西(Andrej Karpathy)在 GitHub 发布了一份名为“LLM Wiki”的构想文档,反思现有检索式记忆范式,并呼吁模型行业构建不断累积、可被自身更新的知识底座。主攻模型记忆的 Mem0,GitHub 已突破六万星标,是过去一年增长最快的 AI 底层开源项目之一。

云基础设施厂商也意识到了这一问题,陆续为其智能体开发平台装上记忆模块:AWS 的 Bedrock AgentCore 中,支持短期会话与跨会话长期记忆的 Memory 成为核心组件;微软 Azure 也开放了 AI Foundry Memory 模块。

行业整体动向共同指向一个趋势,记忆正从附属功能升级为 AI 的必备基础设施。不过,解决记忆问题的技术不止一种,谁的路线能最终跑通?



从“外挂检索”到“内生记忆”:三代技术路线的演进

回顾过去两年多的行业实践,可以按技术深度将其大致划分为三代。

第一代是向量检索式记忆,即当下最主流的检索增强生成(RAG)路线。技术原理在于,将历史信息切分成小块,分别转成向量后存入外挂数据库;对话触发后,系统按相似度检索出若干片段,拼接进提示词供模型参考。

这条路线的最大优势是工程门槛低、生态成熟,LangChain 等主流智能体框架都提供开箱即用的实现。局限也同样明显:该路线很难实现跨场景迁移,它的本质是“查字典”,模型无法真正理解片段之间的关系,不会主动遗忘过时的偏好,也不会根据新交互来更新判断。

第二代是结构化记忆,包括引入知识图谱、分层存储或“记忆操作系统”等架构。该路线将向量条目按实体、关系、时间等维度组织起来,与前代相比多了关系建模能力,也能对不同优先级的记忆做分层管理。

但它并未跳出“外挂”的框架,只是给 AI 搭建了更聪明的资料库:存储依然是静态的,检索依然是被动的,记忆系统依然不会从交互中自主进化。

第三代是内生记忆,这一路线彻底放弃了向量检索,试图让记忆成为模型的原生能力:通过强化学习进行端到端训练,让模型在前期训练和后续使用中学会记忆的写入、压缩、遗忘与调用。

三代之间的差异,本质上是“存储与检索”到“决策与学习”的范式迁移。前两代把记忆视为一个信息管理问题;第三代把记忆视为一个序列决策问题:AI 记忆能力的升级,取决于其能否被建模为一个可训练、可评估、可优化的学习系统。

落到评测层面,AML 首期榜单中,第一名与后位系统间超过十分的差距,很大程度上正源于不同模型在不同路径上演化的进度。



第一名背后,AI 如何学会“管理记忆”?

AML 将参评系统的参与限定在 Add(写入和更新记忆)与 Search(检索记忆),最终的 Answer(基于检索结果生成回答)和 Eval(评分)则由平台统一完成,从而在一定程度上减少回答模型、Prompt 和评分规则不同带来的干扰。

从整张商业榜单来看,各记忆模型公司的能力结构呈现出显著的差异与分化。其中,MemOS 在事实召回、多跳推理、时间推理和记忆治理上表现较好,这与其强调结构化、可编辑与自演化的技术路线相呼应。

网易 NTES-MEMORY-SMART 个性化能力高达 57 分,在用户意图与偏好理解方面具有优势。

综合评分排名靠前的 TencentDB Agent Memory、Mem0、SuperMemory 等框架则各有优劣,总体而言,高阶记忆管理能力还有提升空间。

而本次拿下榜单第一的 MemoraX ,其在事实召回、多跳组合、时间与事件、记忆治理、个性化、规则执行、安全与隐私七个维度中都取得最高分。


图 | 榜单前三名不同维度得分对比(来源:AML)

基于此,一个更值得深入讨论的问题是,这位“优等生”为何不偏科?原因在于,MemoraX 已经来到 AI 记忆路线的第三层:模型原生。实现了从强化学习、大模型后训练到记忆策略学习,再到长期记忆评测与工程化的技术链条闭环。围绕这一思路,MemoraX 目前形成三层技术体系。

第一层是可学习记忆策略引擎,传统记忆方案主要依靠人工规则、Prompt 或固定流程实现。但 MemoraX 希望借助强化学习,让模型在长期交互中自主完成记忆管理决策。

第二层是记忆基模。与直接调用通用大模型处理所有任务不同,MemoraX 将其定位为专门针对长期记忆任务训练的模型,处理超长上下文、时间关系以及记忆压缩等问题。

第三层则是自演进 Agent Harness,将实际应用产生的交互和反馈重新引入系统,让前面的记忆策略能够继续迭代。

总体而言,MemoraX 真正想改变的是模型记忆的底层逻辑:不只是堆信息量,更关键的是让 AI 自己决定“什么值得记”。

支撑这套技术体系的,是团队在产业落地与算法创新两方面的长期积累。MemoraX AI 的核心成员一部分曾是华为、阿里、腾讯等企业的大模型研发与 Agent 团队技术负责人,合作成果曾在芯片设计、游戏AI、推荐搜索等工业级场景大规模落地。

另一部分则是国内强化学习领域的头部研究力量,兼具学术与产业化经验。以团队的代表性工作 ReMix(ICLR 2026)为例,它支持在后训练中安全复用历史数据,解决了强化学习的数据浪费问题。在部分设置下,训练数据效率可提升 30 至 450 倍。这种能力实际上就可被迁移至模型的高阶记忆中。

围绕大模型后训练、Test-Time Scaling 等方向,团队与多所高校合作的 10 篇论文已被 ICML 2026 录用。相关工作曾获中国电子学会自然科学奖一等奖、中国图像图形学会科技进步奖一等奖。

AML 不是 MemoraX 交出的第一份考卷。更早之前,MemoraX 已在几个不同类型的记忆基准取得亮眼成绩:在南京大学与上海 AI Lab 联合发布的 LoCoMo-Refined 基准上拿到 82.65 分、领先第二名 30%;在与牛津大学联合开源的剧本记忆基准 ScriptMem 上正确率 60.3%、领先第二名 40%;在编程领域的 SWE-context-bench 上任务解决率 45%、领先第二名 50%。

如今,为推进 Agent Memory 愿景落地,MemoraX 正在快速推进商业化。2026 年 4 月,公司完成千万美元种子轮融资,5 月完成数千万元人民币种子+轮,8 月又宣布完成数亿元种子++轮。据悉,公司还与华为云签署战略合作,目前是后者合作厂商中唯一聚焦长期记忆的企业。

当然,Benchmark 测试的是特定规则和数据集下的表现,真正的验证必须在生产环境中进行。

应用场景方面,MemoraX 正在覆盖 Coding Agent、医疗健康、智能家居、智能穿戴和具身智能等方向。在AI Coding 领域,其产品试图让 Codex、Claude Code 等 Agent 持续理解项目上下文和历史开发经验。在慢病管理中,则需要持续理解用户状态;进入家庭和智能终端后,需要沉淀家庭成员习惯与设备偏好。

在产品路径上,公司将进入企业知识管理、智能客服等 B 端领域,同时在个性化智能助手以及交互式产品等 C 端应用也有布局。



AI 记忆,距离真正的基础设施还有多远?

长期来看,AML 榜单上展现出的性能,究竟能否在数月乃至数年的实际运行中维持,是整个 AI Memory 赛道需要面对的考验。

目前 Agent Memory 最成熟的评测仍集中在文本,MemoraX 也已经在图像记忆相关 Benchmark 上进行验证。但智能眼镜、耳机、家庭机器人等真正需要长期记忆的设备,收集的信息往往是包括视频、语音甚至高度不确定的现实环境等多种模态。

如何为时间、空间序列下的海量内容搭建稳定可用的记忆决策框架,将成为模型原生记忆领域最大的技术挑战之一。

而榜单覆盖的维度再全面,也只能衡量记忆系统在特定数据集与评测规则下的能力切片。进入生产环境后,平台面对的是更复杂的现实变量:成本、延迟、隐私权限、记忆存储时长,每一项都直接关乎用户信任和商业效益。更关键的是,作为一个长程系统,AI 记忆一旦出错,后果将随时间不断放大,记忆系统的迭代与纠错能力有时或许比“记住”更重要。

推理能力的竞赛已经白热化,而一个记不住上下文的 AI,终究只是“聪明的陌生人”。先让 AI 变成“靠谱老搭档”的公司,才有望在 AI 时代的下半场掌握先发优势。

参考资料:

https://agentmemoryleaderboard.ai/leaderboard/industry/textual

https://github.com/mem0ai/mem0

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
院士:最佳“控糖运动”是这3种,一次几分钟就管用!不是跑步

院士:最佳“控糖运动”是这3种,一次几分钟就管用!不是跑步

健身狂人
2026-09-04 07:46:01
研究发现:癌症患者过了75岁,基本都有这4个现状,建议坦然接受

研究发现:癌症患者过了75岁,基本都有这4个现状,建议坦然接受

周哥一影视
2026-09-11 10:30:15
宁可被骂也无所谓了!惠州女孩月薪3000扛不住6000房贷,发视频喊话国外前男友回来收回房子。

宁可被骂也无所谓了!惠州女孩月薪3000扛不住6000房贷,发视频喊话国外前男友回来收回房子。

捣蛋窝
2026-09-09 13:59:20
A股:不必等待了,尾盘传来两个信息,下周一重要时刻来了

A股:不必等待了,尾盘传来两个信息,下周一重要时刻来了

明心
2026-09-11 16:20:59
张丹丹被免去北大行政职务、没有涉及学术职称

张丹丹被免去北大行政职务、没有涉及学术职称

大国老记老顾
2026-09-11 13:09:17
A股:没必要等收盘了,种种迹象很强烈,9月11日周五下午将这样走

A股:没必要等收盘了,种种迹象很强烈,9月11日周五下午将这样走

虎哥闲聊
2026-09-11 11:52:18
湖人官宣举办20年夺冠戒指主题夜:27年1月24日 主场战奇才浓眉回归

湖人官宣举办20年夺冠戒指主题夜:27年1月24日 主场战奇才浓眉回归

醉卧浮生
2026-09-11 08:08:54
上海站救人英雄:安全员不能转身就跑!曝后者日薪仅60元 本应3千

上海站救人英雄:安全员不能转身就跑!曝后者日薪仅60元 本应3千

念洲
2026-09-11 12:11:07
美剧神作排行榜

美剧神作排行榜

喜欢历史的阿繁
2026-09-11 00:50:02
公司年会上,老婆的男秘书当众向她求婚,她红着脸默认了,我笑着起身,从包里拿出一份文件放在桌上,她看了一眼,脸瞬间白了

公司年会上,老婆的男秘书当众向她求婚,她红着脸默认了,我笑着起身,从包里拿出一份文件放在桌上,她看了一眼,脸瞬间白了

晓艾故事汇
2026-09-04 08:39:57
越南敲定北南高铁项目启动时间

越南敲定北南高铁项目启动时间

财联社
2026-09-11 07:01:03
许华升与妻子婷婷爆发婚姻危机!婷婷控诉其一年365天,360天喝酒

许华升与妻子婷婷爆发婚姻危机!婷婷控诉其一年365天,360天喝酒

裕丰娱间说
2026-09-11 10:17:32
公安部172号令生效提醒,六十岁以上持证老车主,将一份重大利好

公安部172号令生效提醒,六十岁以上持证老车主,将一份重大利好

音乐时光的娱乐
2026-09-09 06:57:23
小法:如果只选一位对我执教风格影响最大的教练,那就是温格

小法:如果只选一位对我执教风格影响最大的教练,那就是温格

懂球帝
2026-09-11 08:51:05
魏德尔这番夸奖之后,估计很长一段时间内,德国议会里都没人敢批评中国了

魏德尔这番夸奖之后,估计很长一段时间内,德国议会里都没人敢批评中国了

怪味历史连连看
2026-09-11 10:35:23
早上9点!CCTV5直播亚运会男篮首秀,交手记录男篮胜率100%,郭士强避免爆冷

早上9点!CCTV5直播亚运会男篮首秀,交手记录男篮胜率100%,郭士强避免爆冷

大卫的篮球故事
2026-09-10 16:44:40
导演喊“再亲一下”,井柏然孙千就真亲了:今年最敢放花絮的剧组

导演喊“再亲一下”,井柏然孙千就真亲了:今年最敢放花絮的剧组

小椰的奶奶
2026-09-11 07:42:18
我闺蜜40了,第一次和男友同居后,兴奋的对我说, 这个世界真美好

我闺蜜40了,第一次和男友同居后,兴奋的对我说, 这个世界真美好

来去自如的小章
2026-08-29 07:10:03
科技UP主热议iPhone Duo:15999元折叠屏值不值?

科技UP主热议iPhone Duo:15999元折叠屏值不值?

影视情报室
2026-09-10 15:20:23
她是日本演员,来中国跑龙套15年才爆红,定居北京两次都嫁中国人

她是日本演员,来中国跑龙套15年才爆红,定居北京两次都嫁中国人

嘴角上翘的弧度
2026-09-10 11:55:38
2026-09-11 17:31:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17227文章数 515214关注度
往期回顾 全部

科技要闻

罗永浩连用7个“抄的”吐槽苹果折叠屏

头条要闻

"男子称停资助遭受助学生质问"疑反转 民政局查无此人

头条要闻

"男子称停资助遭受助学生质问"疑反转 民政局查无此人

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

千叶珠宝创始人夫妇失联 股价应声"腰斩"

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

手机
教育
房产
公开课
军事航空

手机要闻

vivo法务部回应“MCN组织博主诋毁品牌被判赔130万”

教育要闻

为什么越在意孩子感受,孩子越脆弱

房产要闻

时隔7年,绿地海南再拿地!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

涉伊朗核问题 中国和俄罗斯投下反对票

无障碍浏览 进入关怀版