大数跨境

RSI走向产业,需要怎样的基础设施?

RSI走向产业,需要怎样的基础设施? DeepTech深科技
2026-09-15
6
导读:Pyromind正在把RSI从实验室概念变成可交付的产品。它的AutoRL体系已在工业质检、具身智能等场景中跑通闭环并产生收入。

两家公司部署同一基础模型,半年后谁的系统更优?答案往往不在于初始架构,而在于部署后的“持续学习机制”。一家企业若仅将失败案例留存日志,另一家则将其转化为训练素材并定期迭代,业务表现便会逐渐拉开差距。

这种差异的核心在于递归自我改进(Recursive Self-Improvement,RSI):让 AI 在完成任务的同时,参与分析错误、提出方案并驱动下一轮进化。OpenAIGoogle 等前沿实验室已将 Agent 纳入内部研发闭环,由 AI 辅助代码编写、实验运行及模型评估。当 RSI 走向产业应用,关键挑战转变为:如何构建一套自动化机制,将业务反馈、训练、评估与更新无缝连接,使模型能自适应任务变化,而非依赖专家反复重构流程。

图丨两家公司部署同一基础模型后,是否建立持续学习机制,半年内可能带来显著的表现差异(来源:DeepTech)

国内公司 Pyromind 较早围绕此方向布局,通过自动化强化学习(AutoRL)将真实任务数据反馈至后续训练与评估,已在软件 Agent、工业任务及具身智能领域取得量化成果。要判断其是否具备真正的产业化能力,需审视 RSI 落地必须经受的四大检验。

RSI 进入产业,先要经得起哪些检验

首先,经验必须真正转化为模型能力。Agent 的执行轨迹与用户反馈若仅用于检索或人工排查,仍属外围辅助;唯有将业务反馈转化为训练信号并更新参数,经验才算内化为能力。系统需具备数据筛选、归因分析及目标设定的智能,并能验证优化效果。

其次,系统需具备应对环境变化的持续性。一次性能提升不足以证明成功,真正的考验在于新数据流入时,训练评估流程能否自动重启,且在提升新能力的同时避免旧能力退化。对企业而言,更新的可控性与依据比频率更为重要。

再次,交付过程需形成可复用的资产积累。若每个新项目都需专家团队重新设计数据处理与训练流程,规模化便无从谈起。只有将方法论沉淀为通用机制,才能实现规模经济。

最后,技术指标必须转化为经济账本。准确率与效率的提升,需对应人工成本降低或质量损失减少。唯有客户能从每次更新中获得可计算的 ROI,持续训练才能成为长期服务

图丨RSI 进入产业的四个标准(来源:DeepTech)

综上,"RSI 早期产业形态”可定义为:在具体任务边界内,将经验积累、能力更新与结果验证组织成一套可运行、可重复的系统,并逐步提高改进过程的自动化程度。

Agent 越多,持续学习越需要成为通用基础设施

Pyromind 创始人 Kevin Ding 指出,当前 Agent“会工作但不会成长”。在 GUI Agent 项目中,即便通过微调提升了已知任务成功率,一旦界面更新,表现便会回落。这种困境普遍存在:软件迭代、物料更换或规则变动都会引发新错误,而恢复表现往往依赖算法工程师的人工介入。

基础模型的通用升级无法替代场景适配。以工业质检为例,漏检与误报的权衡取决于企业具体的成本与风险策略,通用模型难以预设答案。因此,对于环境多变、反馈持续且人工维护成本高昂的场景,AutoRL 显得尤为关键。

随着 Agent 渗透至更多业务环节,各部门重复搭建数据清洗与训练体系将造成资源浪费。将共通部分抽离为通用基础设施,是降低长期维护成本的必由之路。

图丨Pyromind 产品层级(来源:DeepTech)

Pyromind 的产品演进印证了这一路径:从可视化训练引擎 Studio,延伸至协助轨迹筛选与归因的 Studio Copilot,再到连接数据回流、自动评估与版本更新的 EchoMind。目前,其后训练服务正从"Agent 辅助”向更高程度的自动化过渡,旨在无需重建系统即可随场景成熟度提升自动化水平。

三类场景,检验同一套学习机制

Pyromind 的实际案例为 RSI 的可行性提供了多维样本:

软件 Agent:焦点识别精度的跃升

在与欢网合作的 Android TV 遥控器操作任务中,团队对 Qwen3-VL-4B 进行强化学习训练。利用真实操作轨迹(含成功与失败案例),模型焦点识别准确率从约 45% 提升至 99.6%。通过 EchoMind 接入生产环境,数据回流、奖励构造至版本部署形成了连续闭环,项目资产得以保留并服务于后续迭代。

工业视觉:专业规则的量化转化

在华秋电子元件输出任务中,Pyromind 将复杂的工程规则转化为可训练标准。训练后,渲染相似度的交并比(IoU)指标从 0.2 提升至 0.65。该案例表明,虽然训练调度等流程可复用,但行业知识与奖励函数仍需针对新场景进行适配。

具身智能:真机数据的高效采集

在机器人领域,R2VLA 方案实现了真机环境下 24 小时连续数据采集,无需人工遥操作,并将采集链路时间缩短 50% 以上。这解决了具身智能学习中数据生产效率的瓶颈,为后续的评价、训练与验证奠定了基础。

图丨Pyromind 具身智能整体技术闭环(来源:DeepTech)

三类场景虽任务各异,但核心逻辑一致:记录经验、筛选高价值信息并验证能力获取。最终,这一切需经由 ROI 检验。例如在某质检任务中,团队用约 1 万张样本将误报率从 23% 降至 8%,直接减少了人工复检成本,证明了持续训练的商业价值。

从项目闭环走向通用基础设施

当前的 RSI 并非完全自主的系统,而是一种半自动的持续训练基础设施:人提供行业知识与关键判断,系统负责高效执行转化流程。

现有工具多按环节分布,导致每次更新仍需专家重新搬运数据与翻译标准。AutoRL 系统能否成为通用基础设施,关键在于随着项目增多,新增交付所需的专家时间与边际成本能否持续下降。Pyromind 的实践表明,围绕完整更新链路建设产品,能让过往的数据处理方法与评估记录服务于新一轮迭代,从而减少重复调试。

图 |Pyromind 对 RSI 四个阶段的划分(来源:Pyromind)

完整意义上的 RSI 仍是行业远期目标。Pyromind 的先发优势在于较早将生产反馈、奖励设计、训练评估与模型更新纳入统一产品路线,并通过真实客户与量化指标进行了验证。尽管跨场景复用程度与长期更新的稳定性仍需更多数据支撑,但其以 AutoRL 推进产品、以 ROI 检验更新的模式,已为这条前沿技术路线提供了可观察、可验证的产业样本。

注:封面/首图由 AI 辅助生成

【声明】内容源于网络
0
0
DeepTech深科技
DeepTech 是一家专注新兴科技的资源赋能与服务机构,以科学、技术、人才为核心,通过科技数据与咨询、出版与影响力、科创资本实验室三大业务板块,推动科学与技术的创新进程。DeepTech 同时是《麻省理工科技评论》中国区独家运营方。
内容 5664
粉丝 2
DeepTech深科技 DeepTech 是一家专注新兴科技的资源赋能与服务机构,以科学、技术、人才为核心,通过科技数据与咨询、出版与影响力、科创资本实验室三大业务板块,推动科学与技术的创新进程。DeepTech 同时是《麻省理工科技评论》中国区独家运营方。
总阅读125.6k
粉丝2
内容5.7k