什么是 RSI:从自我改进到递归增益
-
持久改进:有效变化能进入权重、记忆、工具、驾具或训练流程,而不是一次回答结束就消失。这里的权重也叫参数,就是模型在训练中不断调整、最终保存下来的那组数字。达成这一条,才谈得上自我改进——本文用这个词泛指输出、记忆、参数或驾具变好。 -
自主闭环:系统能在划定的边界内发现问题、提出修改、执行实验、评估结果并接纳更好的版本。新版本能在这条边界内参与下一轮改进,本文称为有界 RSI。 -
递归增益(也叫”点火”,ignition):新版本不只在任务上分数更高,还比旧版本更擅长产生下一次改进。只有跨过这一条,”改进能力本身”才开始复利,本文称之为递归自我加速。 -
稳健与可控:增益在固定资源和隐藏评测下持续、能泛化到未见任务,同时不以评估污染、系统复杂度失控、对齐退化或不可审计为代价(对齐指让 AI 的行为符合人类意图和边界,而不只是把某个分数做高)。四条标准全部达成,才接近开放式 RSI。
什么是 RSI:从自我改进到递归增益
第一次推进(2022–2023):
让AI从自己的错误中学习
第二次推进(2022–2024):
用自己生成的数据训练自己
第三次推进(2022–2025):
把更多打分权交给 AI
第四次推进(2023–2026):
让AI修改自己的运行方式
第五次推进(2025–2026):
把学习与研究过程放进闭环
2026 年夏:
自动研究系统开始改进自身的研究方式
统一视角:
如何判断RSI走到了哪一步
结语:
自我改进闭环已经出现
递归增益仍待证明
参考文献:
1.Darwin Among the Machines(Samuel Butler, 1863):https://en.wikipedia.org/wiki/Darwin_among_the_Machines
👇 点个“在看”分享洞见

