网易首页 > 网易号 > 正文 申请入驻

对话Memories.ai沈俊潇:用视觉记忆驱动物理AI自进化

0
分享至



模型能否像人类一样真正“看见”,并形成持久“记忆”,是过去两年 AI 领域内最受关注的命题之一。

2024 年,正值大语言模型在文本推理上不断突破天花板,而视觉记忆这一被认为更接近人类认知本质的能力,仍是尚未被探索的领地。前 Meta 现实实验室(Reality Labs)研究员沈俊潇(Shawn Shen)与周恩民(Ben Zhou)看到了这一领域的机会,在硅谷创办 Memories.ai。

2025 年 7 月,公司走出隐身模式,发布全球首个大型视觉记忆模型(LVMM),同步完成 800 万美元种子轮融资。DeepTech 曾对话沈俊潇,在当时的他看来,公司的目标是让 AI 拥有“类人视觉记忆”,进而服务于安防、个性化助手、媒体创作等场景。

一年多过去,Memories.ai 的成长节奏明显加快。种子轮追加至 1,600 万美元,与高通、英伟达建立合作;并在 2026 年 1 月消费电子展(CES)上发布 LUCI 开发者硬件平台;一系列围绕视觉记忆与模型自进化的研究成果接连发布,还从 Meta 挖来首席 AI 官。

真正值得记录的不只是这些进展。近日,DeepTech 在硅谷再次与沈俊潇对话,他对公司的组织方式,对视觉记忆和物理 AI 的判断,都进一步收敛至更清晰的维度。

Memories.ai 一直保持着精简的团队规模。创业以来,沈俊潇大部分的时间不是花在管理公司上,而是作为掌舵者把握公司的发展方向,还有最重要的一点,招到对的人。

沈俊潇曾在公司内部做过一个小实验:让 5 个人和 1 个人分别做同一件事,最后发现 1 个人反而更快。因此,他现在招人更看重高能动性,以及与公司愿景对齐(vision aligned)。

他向我们介绍了公司最新的聚焦方向:记忆只是最基础的事,更重要的,是让 AI 通过视觉记忆实现自我进化。

记忆的两种定义

“AI 记忆”这个概念在 2024 到 2025 年间经历了一次快速膨胀。个人化助手需要记住用户偏好,长上下文对话需要跨会话检索,检索增强生成(RAG)被广泛用于知识管理。到 2026 年,开源工具 Mem0 已经把文本记忆做成了标准化组件。

在对话中,沈俊潇把“AI 记忆”一分为二。第一种为个性化服务,让 AI 更懂你;第二种为自我进化服务,让 AI 把活干得更好。他判断,前者的护城河正在快速消失:“随着大模型能力越来越强,这些东西都会被基础模型直接内化。所谓的个性化 AI,实质上只是一批 Markdown 文件加一层智能体的执行框架。”

真正让他觉得值得投入的是第二种。沈俊潇告诉 DeepTech,“我们讲的记忆更多是关于世界的记忆”,目标是让机器人和物理智能系统在部署到新场景时,能够依靠积累的视觉经验自我修正、自我提升,最终达到“物理世界的递归自我进化”(Physical RSI)。

这个判断建立在一个关键的技术前提之上:文字是大模型的原生模态,但视频不是。

大语言模型可以通过写笔记、做摘要、调用检索工具,自主管理文字记忆。但视频太密、太重、太非结构化,还被时间轴锁定。用沈俊潇的话说:“想管理好视觉上下文,需要搭建用于索引视频,生成结构化数据并以特定方式存储的脚手架,这是一套巨大的基础设施工程,很难由大语言模型自主搭建。”

做好视频记忆的脚手架,是 Memories.ai 一系列技术工作的核心。他们在编解码器(codec)层面做压缩编码,自主训练模型,将视频转成向量,把视频转成描述文本。所有经过编码和索引的视频数据,最终都汇入公司自建的视频数据湖。

投资方三星 Next 披露,Memories.ai 在发布 LVMM 时已经索引了超过 100 万小时视频,通过记忆整合把片段压缩为关键视觉特征,同时保留上下文关联,其视频记忆容量是同类方案的 100 倍。

这一策略已经得到了大厂认可。2025 年 11 月,公司与高通建立合作,LVMM 2.0 从 2026 年起在高通处理器上原生运行,将编码、压缩和索引功能下放至设备端,以此降低延迟、节约云端成本、保护隐私。今年 3 月的 GTC 大会上,Memories.ai 的视觉记忆技术被接入英伟达的 Cosmos-Reason 2 和 Metropolis 平台。

“每轮迭代提升 1% 到 2%”

沈俊潇对物理 AI 自进化的预期是,公司为客户部署视觉理解模型时,初始准确率大概在 70%,后续通过模型自我进化,准确率可以升至接近 90%。“每次迭代提升 1%~2% 左右,同时把对人类标注数据的需求量压至最低。”

他进一步解释了具体流程:模型部署到新场景后,Memories.ai 的视频数据湖将持续记录所有原始视觉数据。当模型出现识别错误、决策失误、场景理解偏差等失败模式(failure pattern),系统会自动从视觉记忆中定位相关片段,把失败案例反馈至模型训练环节,进行针对性的后训练。

以具体场景为例,沈俊潇描述了他们希望达到的目标状态:“未来部署一个机器人到新的店,每个店的场景都不一样,边缘情况(edge case)也不一样。客户肯定不希望每次出现边缘情况,都由专人负责对其定义。最好的情况是,所有过程都被记录下来,机器人自己直接从中学习怎样做得更好。”


(来源:Memories.ai)

这一方向和当下物理 AI 的核心痛点相契合。数据平台厂商 Voxel51 2026 年 6 月发布了《2026 视觉与物理 AI 现状报告》,他们发现,78% 的团队正在从视觉与物理 AI 项目中获得实际价值,但几乎所有团队都反映模型表现不达标。模型架构不是主要限制,数据质量、样本覆盖度、标注工作流和类别不平衡才是根本瓶颈。

在沈俊潇看来,加速自我进化的关键并不在算法层面:“算法只能在失败模式中获得加速,但我们想做到的是,出现 100 个失败样本后,能把它全部都用起来,以此进一步提升模型的能力。”

场景明确后,Memories.ai 的商业模式也比刚成立时更清晰了。

沈俊潇把客户明确分成两类。第一类是工厂、连锁快餐店和商超等企业客户。这些场景需要用视觉理解模型做标准作业程序(SOP)检查、库存监控、异常识别等工作。Memories.ai 帮他们做视觉模型的后训练和部署,同时把这些场景里产生的真实视频数据留在自己的数据湖里。

第二类是主攻视觉-语言-动作(VLA)模型或世界模型的前沿机器人实验室。Memories.ai 把从企业场景积累的视频数据分享给这些实验室,帮助他们训练机器人模型,这些机器人未来又可以部署回工厂和商超场景。

从场景数据到前沿实验室,再到反哺机器人运行,一个数据飞轮就此形成,给公司带来了自我造血的能力。

用真实世界和真实需求做生意

所有看重数据的团队难免都会面临一个选择:究竟是用更好的架构以少量数据取胜,还是通过数据规模取胜。对于这个问题,沈俊潇的态度很明确:“我个人更相信规模化(scaling)。大家靠着 scaling 发展到今天,未来依然如此。当然,也不排除未来可能会出现新的技术突破,让 scaling 变得不再必要。”

至于数据来源,沈俊潇告诉 DeepTech,他更偏好真实世界的数据。对比之下,仿真环境虽然可用,但模型最终仍要在真实环境里部署、接受检验;世界模型则更适合作为基础模型,结合机器人数据开展后训练。

这些判断并不意味着 Memories.ai 无视了数据的利用效率。事实上,团队近期发布的多项研究成果都与压缩、内存效率、多模态融合密切相关。MARC 通过强化学习驱动的令牌压缩,把视觉令牌负载降低 95%,同时保留完整帧模型的推理能力;O-MARC 让全模态音视频推理速度提升 34.6%、内存效率提升 34.7%;OmniRetriever 在音频、视频、文本的统一检索空间里,音频检索零样本表现超过谷歌 Gemini;SpatialMem 则通过标准第一人称 RGB 视频构建可查询的 3D 索引。

在物理 AI 领域,Memories.ai 的竞争对手有很多。问及和其他同类型公司最大的差异时,沈俊潇强调了两点关键优势:一方面,他们将视频数据湖与视觉理解模型深度绑定,数据可伴随企业客户的部署天然沉淀,无需从外部采购;另一方面,公司已经找到了合适的生态位,将业务明确限定在“为客户做数据评估和模型后训练”,既不计划亲自下场做机器人,也不会抢 VLA 模型公司、世界模型公司的生意。

访谈接近尾声,沈俊潇再次与 DeepTech 聊起了 AI 记忆的定位转移。在他看来,记忆作为一个独立品类的市场空间已经很有限,“真正把记忆做成一门好生意的公司其实很少”。

个性化记忆是长程任务里的一环,但不应是终极目的:“记忆固然让人变得更独特,例如我知道我昨天、前天都做了什么。但对于模型来说,重要的不是让 AI 懂你,而是看它能不能利用记忆帮你把任务完成得更好,最好是用很少的提示(prompt)完成更长程的任务。”

从更宏观的角度看待未来趋势,沈俊潇把 AI 系统分为“内核”和“外核”:内核指模型能力,外核指个性化、交互体验、言行举止更接近人等体验层的差异。“当内核还在指数级增长的时候,大家会更专注内核,其他事情都显得没那么重要。等内核不增长了,才轮到从外核处寻找差异化。而现状是,内核依然在不断膨胀。”

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
德黑兰女性公然脱掉头巾,伊朗高层:大敌当前,不敢抓

德黑兰女性公然脱掉头巾,伊朗高层:大敌当前,不敢抓

民间胡扯老哥
2026-09-18 06:22:39
武汉34岁医学博士11天捐精5次猝死,老父索赔400万,后来怎样了?

武汉34岁医学博士11天捐精5次猝死,老父索赔400万,后来怎样了?

夜话奇谭
2026-09-18 18:57:36
从犯规落后到破纪录夺冠,严子怡用68米42的成绩完成自我救赎。

从犯规落后到破纪录夺冠,严子怡用68米42的成绩完成自我救赎。

奔跑的象牙塔
2026-09-07 00:05:16
实在太强了!不愧前世界第一,朱雨玲3:1击败现世界第一王曼昱

实在太强了!不愧前世界第一,朱雨玲3:1击败现世界第一王曼昱

杨哥乒乓
2026-09-20 19:09:13
这6种药不宜长期服用,破坏身体免疫力!很多人都不知道!

这6种药不宜长期服用,破坏身体免疫力!很多人都不知道!

健康科普365
2026-09-18 14:30:16
德泽尔比:在我14年的执教生涯中,从未见过像热刺这样的球队

德泽尔比:在我14年的执教生涯中,从未见过像热刺这样的球队

画夕
2026-09-20 07:26:02
舆论反转!“我怎么知道你没穿衣服”,长沙快递员上门取件,裸身女子被看光,网友:支持快递员反诉

舆论反转!“我怎么知道你没穿衣服”,长沙快递员上门取件,裸身女子被看光,网友:支持快递员反诉

火山詩话
2026-09-20 18:05:19
房价很大可能重走1998年老路!所有人一定要提前做好心理准备

房价很大可能重走1998年老路!所有人一定要提前做好心理准备

偷喝一口奶
2026-09-11 08:36:30
大阪街头埃尔法贴着:车内有中国人……

大阪街头埃尔法贴着:车内有中国人……

日本物语
2026-09-12 20:36:48
俄罗斯库尔斯克核电站冷却塔被无人机击中;国际原子能机构:针对核设施的任何袭击都不可接受,各方应保持最大限度的军事克制

俄罗斯库尔斯克核电站冷却塔被无人机击中;国际原子能机构:针对核设施的任何袭击都不可接受,各方应保持最大限度的军事克制

鲁中晨报
2026-09-19 09:59:02
每体:克里斯滕森受伤后,孔德可能会重返巴萨首发阵容

每体:克里斯滕森受伤后,孔德可能会重返巴萨首发阵容

懂球帝
2026-09-20 18:18:18
真的来了!特斯拉开启新车预订,国内为 33.2 万!

真的来了!特斯拉开启新车预订,国内为 33.2 万!

XCiOS俱乐部
2026-09-19 19:31:50
美国万万没想到!早些年,大批逃往境外的中国贪腐和经济犯罪嫌疑人,最终竟在中国这里碰了软钉子

美国万万没想到!早些年,大批逃往境外的中国贪腐和经济犯罪嫌疑人,最终竟在中国这里碰了软钉子

z千年历史老号
2026-09-18 18:17:42
大家发现没,王楚钦越来越不对劲,不是球技断崖下滑,也不是长相变化,而是精气神肉眼可见地被透支

大家发现没,王楚钦越来越不对劲,不是球技断崖下滑,也不是长相变化,而是精气神肉眼可见地被透支

乒乓助手
2026-08-21 00:37:44
为什么近两年3D电影彻底消失了?

为什么近两年3D电影彻底消失了?

潮式呼吸
2026-09-19 22:05:35
吃里扒外!定居美国13年,回国捞金惨遭'驱逐',53岁活成了笑话

吃里扒外!定居美国13年,回国捞金惨遭'驱逐',53岁活成了笑话

李橑在北漂
2026-09-20 18:47:45
9月份剩下这几天 还将有4波冷空气“造访”

9月份剩下这几天 还将有4波冷空气“造访”

闪电新闻
2026-09-20 15:18:46
国产突围!长鑫宣布第五代技术平台正式量产:晶圆产出提升50%以上

国产突围!长鑫宣布第五代技术平台正式量产:晶圆产出提升50%以上

快科技
2026-09-20 12:30:09
江珊与丈夫素颜同框,平淡烟火气,十分接地气

江珊与丈夫素颜同框,平淡烟火气,十分接地气

娱你同欢
2026-07-29 22:50:17
原来他俩是敬一丹弟弟!如今身居高位,同胞四人名字细品大有乾坤

原来他俩是敬一丹弟弟!如今身居高位,同胞四人名字细品大有乾坤

莫地方
2026-09-18 23:27:10
2026-09-20 20:24:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17279文章数 515218关注度
往期回顾 全部

科技要闻

谷歌承认:AI模型“黑”进3家公司

头条要闻

"失独"母亲58岁生子60岁再诞一女:希望孩子能有个伴

头条要闻

"失独"母亲58岁生子60岁再诞一女:希望孩子能有个伴

体育要闻

游泳2小时6金!亚运金牌榜:中国11金领跑

娱乐要闻

许嵩刚官宣结婚,冯禧黑历史就被扒

财经要闻

民企土地 被政府"无偿收储"后转手卖7亿

汽车要闻

FREELANDER神行者8开启交付 首批新车正式交付用户

态度原创

亲子
艺术
数码
健康
公开课

亲子要闻

十件事看透孩子的心理!

艺术要闻

米芾写出 800 年来最美行书!字字精彩绝伦,外行看了都说美!

数码要闻

AMD Venice性能测试公布:碾压至强6980P与英伟达Vera

有人倒地抽搐?!是癫痫还是中风?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版