网易首页 > 网易号 > 正文 申请入驻

RSI走向产业,需要怎样的基础设施?

0
分享至



两家公司使用同一种模型,半年后,谁的 AI 会更好用?

刚部署时,它们的能力起点可能相近。但进入业务后,两套系统会遇到不同的客户、流程和异常。一家公司遇到的失败案例,可能只是留在日志里,等工程师有空再排查;另一家公司则把这些反馈整理成训练材料,定期更新模型,并检查改进是否有效。

半年后,双方使用的模型架构或许仍然相同,业务表现却可能逐渐拉开差距。区别来自部署之后:企业能否把每天发生的事情,变成下一次做得更好的依据。

如果进一步让 AI 参与分析错误、提出改进方案、运行训练和评估,这条学习链路就有机会持续运转:AI 在完成任务的同时,也开始参与决定下一轮学什么、怎么学,以及如何判断是否学得更好。这正是递归自我改进(Recursive Self-Improvement,RSI)越来越受到行业关注的原因:让 AI 帮助研发更强的 AI,再用更强的能力推动下一轮进化。

前沿实验室已经将其纳入实际研发过程。9 月 6 日,OpenAI 披露,Agent 已参与内部的代码编写、实验运行和结果分析;Google 此前发布 Gemini 3.8 Flash 时,也提到长期运行的 Agent 循环参与了底层模型的评估与改进。人类仍然掌握研究方向和关键决策,但部分改进工作正在交给 AI。

这些进展为 AI 行业的竞争增加了一个维度:除了模型当前有多强,还要看研发体系能否更快、更可靠地推动下一轮进步。而当 RSI 进入企业应用,问题会变得更加具体:业务经验能否持续帮助模型适应任务,而无需每次都由专家重新组织整套改进流程。

这也是 RSI 走向产业需要建设的基础:把反馈、训练、评估和更新连接起来,再逐步提高改进过程的自动化程度。企业需要积累的不只有业务数据,还有一套能够持续利用这些数据的机制。


(来源:DeepTech)

Pyromind 是国内较早围绕这一方向构建产品的公司。它通过自动化强化学习(AutoRL)让真实任务产生的数据和反馈进入后续训练与评估,使部署后的模型具备持续更新的可能。目前,这套方法已经用于软件 Agent、专业工业任务和具身智能,并取得了一些可量化的结果。

不过,单一项目的性能提升只能说明训练方法是否有效,还不足以判断一家公司是否真正具备 RSI 的产业化能力。要看清 Pyromind 所处的位置,需要先回答一个更基础的问题:RSI 进入产业,究竟要经得起哪些检验?

RSI 进入产业,先要经得起哪些检验

一套系统要证明自己具备持续改进能力,首先要看经验是否真正进入了模型。

Agent 在真实任务中会留下执行轨迹、失败案例和用户反馈。许多系统已经积累了大量日志,但这些信息如果只被用于检索、提示词优化或人工排查,仍然属于模型之外的辅助能力。后训练提供了另一条路径:将业务反馈转化为训练信号,进一步更新模型参数。

而要走通这条路径,系统需要判断哪些数据值得学习、错误为什么发生、优化目标如何设定,随后还要验证模型是否获得了预期能力。只有完成这一步,业务经验才算从运行记录变成了模型能力。

一次训练取得提升,也不能说明系统已经具备持续改进能力。真正的考验来自下一次环境变化:新数据进入后,训练和评估流程能否再次运行?新能力是否提高,旧能力有没有退化?异常出现时,系统能否回退到可靠版本?这里的“持续”并不意味着模型收到反馈后立即改变,更现实的做法是让数据持续回流,训练和部署按条件触发,经过评估和人工审核后再完成更新。对企业而言,更新是否有依据、发布节奏能否控制,往往比更新频率更重要。

再往后看,交付过程还要形成积累。新客户和新场景接入时,数据处理、训练调度、实验管理和评估方法能否沿用已有经验,决定了这套系统能否规模化。如果每个项目都要投入同样规模的专家团队重新设计,持续学习就很难形成规模经济。

最终,所有技术指标都要落到经济账上。准确率、任务成功率和运行效率的提升,需要对应人工成本、质量损失或维护投入的下降。客户只有从一次次更新中获得可计算的收益,持续训练才可能成为一项长期服务。


图丨RSI 进入产业的四个标准(来源:DeepTech)

这些要求相互制约,训练效果很好,但后续更新高度依赖算法专家,维护成本就很难下降;流程足够自动化,却无法识别模型退化,企业也不会把重要业务交给它;覆盖多个行业,但每次都从零定制,规模化依然无从谈起。

因此,我们所说的“RSI 早期产业形态”,可以被定义为:在具体任务和明确边界内,把经验积累、能力更新和结果验证组织成一套可运行、可重复的系统。随着技术成熟,系统再逐步承担更多改进方案的提出、选择与调整工作。

Agent 越多,持续学习越需要成为通用基础设施

Pyromind 创始人 Kevin Ding 对这个问题的认识,来自团队早期的一段项目经历。

在一个 GUI Agent 项目中,团队希望让 AI 像人一样操作图形界面:识别屏幕内容、点击按钮、填写表单。他们先后更换更强的视觉语言模型,增加提示词和规则,又补充数据进行监督微调。已知任务的成功率提高了,但新的应用和界面出现后,模型表现又会回落。

团队能够修复一个问题,却无法让这次修复自动减少下一次维护的工作量。Kevin 后来将这种状态概括为:“今天的 Agent 已经会工作,但还不会成长。”

这种困境并不局限于 GUI Agent。软件界面会更新,生产物料会更换,业务规则和验收标准也会变化。环境每发生一次变化,Agent 都可能出现新的错误,而恢复表现往往需要算法工程师重新分析问题、调整训练策略并验证结果。

基础模型的升级固然能够提高通用能力,却无法替企业完成场景适配。一家工厂怎样判断缺陷、哪些错误可以容忍、什么情况下必须转交人工,这些要求来自具体业务,需要通过数据和反馈进入系统。

工业质检就是一个典型例子。模型发现疑似缺陷后,怎样才算好的结果,取决于企业的实际目标。如果客户首先要求降低漏检,适度增加人工复检可以接受;如果误报已经造成复检环节拥堵,模型就需要向另一个方向调整。训练目标来自企业在质量风险、人力成本和生产效率之间的具体权衡,通用模型很难预先知道答案。

当然,并非所有任务都需要持续训练。流程稳定、异常有限的标准工作,通过提示词、知识检索和固定工作流就能较为经济地解决。AutoRL 更适合业务环境经常变化、专业反馈持续产生,并且人工维护成本已经难以承受的场景。

当这类场景只有少数几个时,算法团队尚可逐个处理。随着 Agent 进入更多业务环节,各部门分别搭建数据清洗、模型训练和评测体系,会带来大量重复投入。把其中共通的部分抽离出来,逐渐成为一种通用基础设施,才有可能降低长期维护成本。


图丨Pyromind 产品层级(来源:DeepTech)

Pyromind 的产品演进正是沿着这条路径展开。

团队最初推出的 Studio,是一个可视化训练工作流引擎,用于组织数据清洗、训练管线、奖励模型配置和评测流程。它主要解决训练基础设施的搭建和流程复用问题。

进入企业场景后,团队发现训练工具只覆盖了一部分需求。企业通常知道什么结果不能接受,却很难把业务判断直接翻译成训练目标。奖励如何设置、错误如何归因、哪些数据应该进入下一轮训练,仍然需要算法专家逐项处理。

此后,Pyromind 将产品从训练工作流延伸到 AutoRL。Studio Copilot 开始协助完成轨迹筛选、失败归因和评测建议,EchoMind 则进一步连接数据回流、模型训练、自动评估和版本更新。客户提供基础模型端点和业务数据后,系统可以在后台推动更新循环持续运行。关于 Studio、Studio Copilot 和 EchoMind 在这条链路中分别承担什么角色,以及数据、Reward、训练与校验如何衔接,Pyromind 在他们博文《走向 RSI:Pyromind 如何靠 AutoRL 开启模型自进化》中有更完整的介绍。

目前,这条管线尚未实现完全自主,Pyromind 对自身阶段的判断是,后训练服务正在从“Agent 辅助”走向更高程度的自动化。产品按这一方向逐层展开,后续可以随着场景成熟逐步提高自动化程度,而无需反复重建整套系统。

三类场景,检验同一套学习机制

而这种产品设计是否成立,最终要回到实际项目中检验。Pyromind 已披露的几组案例,为我们提供了多种类型的观察样本。

在与欢网的合作中,Pyromind 对 Qwen3-VL-4B 进行强化学习训练。任务来自 Android TV 的遥控器操作:系统需要判断电视屏幕上当前选中了哪个元素,才能继续执行下一步。

据公司披露,训练后模型的焦点识别准确率由约 45% 提升至 99.6%。训练数据来自真实电视界面的操作轨迹,其中既有成功操作,也有失败尝试。这些轨迹经过处理后进入训练,最终带来了模型参数和能力的变化。

随着应用和界面更新,新的操作轨迹也为模型提供了持续学习的材料。在项目的后续交付中,Pyromind 完成了业务奖励模型的适配,并通过 EchoMind 接入生产环境中的操作轨迹,让数据回流、奖励构造、模型训练、自动评估、版本比对和更新部署形成连续流程。

这条流程的价值,不只是完成某一次训练。任务定义、数据处理方法、奖励标准、训练配置和评估结果都能作为项目资产保留下来。下一批数据进入后,团队可以沿用已有流程继续迭代,也能追溯此前哪些调整有效、哪些尝试失败。

华秋项目验证的是另一个环节:专业规则能否转化为训练和评价标准。这个项目面向工业场景中复杂的电子元件专业输出任务,Pyromind 将元器件样本、工程规则和输出标准组织为可训练、可评价的流程。据公司披露,训练后渲染相似度的交并比指标 IoU 由 0.2 提升至 0.65。

电视界面的操作反馈显然不能直接迁移到工程图纸中。进入新的行业,行业内的领域专家仍然要为训练提供相应的业务规则,再将其转化为模型能够训练和验证的目标。两个项目的差异也说明了跨场景复用的实际边界:训练调度、数据处理和实验管理可以复用,行业知识、奖励函数与合规要求则需要重新适配。

到了具身智能领域,循环的起点又发生了变化。机器人要从经验中学习,首先要稳定记录真实设备执行任务时的动作、状态和环境信息。

Pyromind 披露,其 R2VLA 方案能够在真机环境下连续采集 24 小时数据,无需人工遥操作,并将数据采集链路的时间缩短 50% 以上。这一结果首先证明了数据生产效率的改善。采集到的轨迹还要经过评价、训练和真机验证,才能进入完整的模型更新循环。


图丨Pyromind 具身智能整体技术闭环(来源:DeepTech)

从软件 Agent 到要求更高的工业领域,再到机器人,具体任务一直在变,背后的问题却始终不变:如何记录经验,判断哪些信息值得学习,再验证模型是否获得了所需能力。

三类场景分别检验了持续学习链路中的不同关键环节,为 Pyromind 积累可复用的训练、评估和更新能力提供了真实环境。同一套工具进入不同业务后,哪些环节可以沿用、哪些需要重新适配、哪些判断暂时离不开专家,也会变得更清楚。基础设施的通用性,需要从这些差异中逐步建立。

归根结底,这套基础设施能否成长为一门健康的长期生意,最终还要交由客户的 ROI 去结算。Kevin 曾介绍,团队在约 1 万张样本上,将一个质检任务的误报率从 23% 降至 8%。误报下降可以直接减少人工复检工作量,再结合漏检风险、质量损失和训练投入,客户能够判断一次更新是否值得。

这也是 Pyromind 优先进入数据丰富、评价标准较明确、收益可量化场景的原因。只有学习材料、评价依据和经济回报都相对清楚,持续训练才容易进入企业的日常经营。

从项目闭环走向通用基础设施

综合前面的这些案例和标准,我们可以做出判断的是,当前的 RSI 不是一个能够自主决定如何改进的系统,更接近一种半自动的持续训练基础设施:行业知识和关键判断仍由人提供,系统负责将这些输入高效转化为训练、评估和部署流程。

从现有产品形态看,相关工具仍多按环节分布:训练平台负责执行训练,数据工具处理数据,Agent 观测工具记录运行轨迹,评估工具检验模型表现。单个环节的效率已经得到改善,但每次模型更新时,专家往往还要重新搬运数据、翻译业务标准并组织流程。要减少这些重复工作,需要将任务定义、奖励标准、评估口径和版本记录一并沉淀下来,让每轮更新都能沿用此前的积累。因此,判断 AutoRL 这类系统能否从项目能力走向通用基础设施,关键不只是能否做好一个项目,更在于随着项目数量和更新轮次增加,每次新增交付所需的专家时间与边际成本能否持续下降。

Pyromind 的实践为这个判断提供了一个可观察的样本。它的产品和项目演进,始终围绕模型交付后的维护问题展开。团队先在具体业务中寻找解决方法,再将数据回流、奖励构造、训练调度、评估验证和更新部署逐步连接起来,形成产品,并放到更多场景中检验。

相对于靠专家逐次组织训练的做法,围绕完整更新链路建设产品,能够让已有的数据处理方法、奖励配置和评估记录服务于下一轮迭代。一次项目留下的经验,因而有机会减少后续重复搭建和调试的工作。

软件 Agent、工业视觉和具身智能的实践,分别验证了更新链路上的不同能力,也帮助团队分清哪些流程可以复用、哪些行业知识和奖励标准需要重新适配。

而这些实践的行业代表性,在于它们回应了 Agent 长期使用中的共性问题。无论运行在动态软件、专业工业任务还是物理环境中,Agent 都需要适应变化,并从使用经验中继续改进。不同客户的具体要求各异,背后对数据处理、训练组织、效果评估和版本更新的需求却有共通之处。将这些共通能力沉淀为产品,才有可能让项目经验服务更多客户。


图 |Pyromind 对 RSI 四个阶段的划分(来源:Pyromind)

完整意义上的 RSI,仍是整个行业尚未抵达的目标。而 Pyromind 在这一阶段的先发积累,来自较早将生产反馈、奖励设计、训练、评估和模型更新放在同一条产品路线中推进,并通过真实客户、量化指标和投入产出评估检验其中的关键能力。它的进展体现在系统建设、跨场景实践和商业交付的共同积累上,单次训练的指标只是其中一部分。

这条路径还有不少问题等待验证。不同项目之间的复用能在多大程度上降低交付成本,仍需要更多案例和更长时间的数据;新场景的奖励设计仍需要专家参与,长期更新也要持续检查已有能力的退化和新的风险。能否在扩大服务范围的同时,减少重复开发、保持更新可靠,将决定这些先发积累能否形成长期优势。

前沿实验室用 AI 加速模型研发,企业则希望 AI 在投入使用后持续适应业务。两者所处的环境不同,都需要把反馈、改进和验证连接起来,并逐步减少对人工衔接的依赖。对企业而言,基础设施成熟的具体表现,是每次环境变化后,不必再投入同等规模的专家重新调试,改进效果能够持续验证,更新成本也更加可控。

Pyromind 以 RSI 为长期方向,以 AutoRL 推进产品,以 ROI 检验每一轮更新。它当前的价值,是让这条仍然前沿的技术路线拥有了可以观察、验证和持续迭代的产业样本。

参考资料:

https://pyromind.ai/

https://mp.weixin.qq.com/s/ot3trNyNWI4LS4B-dda1eQ

运营/排版:何晨龙

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
宁德时代宣布:正式收购 “吉利系” 85亿规模的电池厂

宁德时代宣布:正式收购 “吉利系” 85亿规模的电池厂

DeepAuto车探
2026-09-15 00:21:45
高校教师的黄金时代已经一去不复返

高校教师的黄金时代已经一去不复返

职场资深秘书
2026-09-15 11:42:27
大腿拉伤!亚运会报销啊!中国男篮的首发3号位

大腿拉伤!亚运会报销啊!中国男篮的首发3号位

篮球实战宝典
2026-09-14 17:57:17
网络热议:大龄剩女的最后归宿到底是什么?评论区炸锅了…

网络热议:大龄剩女的最后归宿到底是什么?评论区炸锅了…

慧翔百科
2026-09-15 08:46:08
全球最古老的钢制军舰:在朝鲜元山港靠泊,从下水算舰龄已有90年

全球最古老的钢制军舰:在朝鲜元山港靠泊,从下水算舰龄已有90年

国平视野
2026-09-14 18:31:33
人不会无缘无故患上鼻炎!研究发现:得鼻炎的人,背后有5个因素

人不会无缘无故患上鼻炎!研究发现:得鼻炎的人,背后有5个因素

健康之光
2026-09-14 19:50:15
哥,带你试驾的妹妹看上你了!

哥,带你试驾的妹妹看上你了!

果粉之家
2026-09-13 12:18:51
刘翔11年到手98万,上海体育局一年工资福利支出超8亿

刘翔11年到手98万,上海体育局一年工资福利支出超8亿

马小白
2026-09-14 17:01:24
中国不记隔夜仇!第五波反制到了,日本直呼受不了,请中方放过

中国不记隔夜仇!第五波反制到了,日本直呼受不了,请中方放过

迷雾中的大眼睛
2026-09-14 11:30:00
中国女篮大换血?个人认为,四名球员该退出,三大悍将可入选

中国女篮大换血?个人认为,四名球员该退出,三大悍将可入选

男足的小球童
2026-09-14 15:12:19
苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

川渝视觉
2026-04-17 22:13:14
林彪为何多次探望远离政治的贺子珍?孔东梅:恐怕只有一个原因

林彪为何多次探望远离政治的贺子珍?孔东梅:恐怕只有一个原因

小豫讲故事
2026-09-14 00:15:07
亲眼目睹藏族少女天葬之行,参加全过程后心悸:颠覆我对生死的认知

亲眼目睹藏族少女天葬之行,参加全过程后心悸:颠覆我对生死的认知

古怪奇谈录
2025-09-09 14:36:35
金球候选门将失误致丢球,主帅公开力挺:沃齐尼亚并未经受太多考验

金球候选门将失误致丢球,主帅公开力挺:沃齐尼亚并未经受太多考验

懂球帝
2026-09-14 22:28:06
高速大整改真来了!不取消120限速,开车方式彻底变样

高速大整改真来了!不取消120限速,开车方式彻底变样

三农老历
2026-09-15 04:13:38
伊朗弹道导弹直扑宙斯盾,美军驱逐舰被打成重伤,美方称全规避了

伊朗弹道导弹直扑宙斯盾,美军驱逐舰被打成重伤,美方称全规避了

史智文道
2026-09-15 09:52:36
国家卫健委呼吁:大家一起为人均预期寿命达到80岁而努力!

国家卫健委呼吁:大家一起为人均预期寿命达到80岁而努力!

南方都市报
2026-09-14 19:09:09
甘肃发布一批干部任前公示

甘肃发布一批干部任前公示

金台资讯
2026-09-15 09:01:17
电子信息制造业发展“十五五”规划发布

电子信息制造业发展“十五五”规划发布

界面新闻
2026-09-15 09:03:44
9场狂进17球!中国足球8岁小将大闪耀:带队夺冠包揽金靴+MVP

9场狂进17球!中国足球8岁小将大闪耀:带队夺冠包揽金靴+MVP

李喜林篮球绝杀
2026-09-14 13:53:26
2026-09-15 12:31:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17243文章数 515213关注度
往期回顾 全部

科技要闻

芯片产业链蒸发超5000亿美元,特朗普大怒

头条要闻

证监会原副主席被判无期 半月内已有9位金融高管落马

头条要闻

证监会原副主席被判无期 半月内已有9位金融高管落马

体育要闻

英格兰业余门将,拒绝去非洲当国王

娱乐要闻

她是敬一丹女儿,把公益当事业

财经要闻

未来五年,电子信息制造业发展规划出炉

汽车要闻

纯电续航960km/迪迪虾上车 腾势N8L纯电售29.98万元起

态度原创

艺术
健康
数码
房产
时尚

艺术要闻

她是影后级女演员,下班后遛鸟、养狗,租房住也很快乐

耳石症vs颈椎病,头晕的原因差太多

数码要闻

华为WATCH D3开启预售:更轻更薄,腕上血压管理迈入新时代

房产要闻

网易房产|《让爱驻下》云首发!以一首歌,致敬广州赶路人

过度防晒,正在掏空女性的骨头

无障碍浏览 进入关怀版