本文有配套的交互报告,含三闭环嵌套交互图、三层次考卷矩阵与剪刀差示意图。
一个被混用的词
“RSI”(Recursive Self-Improvement,递归自我改进)在 2025–2026 年重新变热,但不同人说它时指的东西差别很大:有人指 rollout 筛数据再训练的迭代管线,有人指模型自己改写自己的训练流程,有人指 test-time compute 的扩展。这个词的混乱程度,和它承诺的吸引力成正比。
先引入一个从业者框架。Perplexity 后训练负责人丁铎在一场对谈里把 RSI 和持续学习分成了两条路线:一条不改模型参数,优化 harness、loop 和求解流程;另一条直接更新模型权重。他的判断是前者更快出结果,后者可能带来更深的能力变化;而两条路线共同的硬问题是三个——控制成本、避免参数污染、证明持续学到的是可迁移能力。本文后面会反复回到这三个问题上。
另一个常见混淆在 test-time 这个词上。经典 TTT(Test-Time Training,Sun et al. 2020)指的是推理时对当前输入做梯度更新;而 s1 带火的 “test-time scaling” 指的是延长推理链、加预算,不碰权重。LLM 语境里说"test-time 新范式"时,一定要问清指的是哪个——前者是真改模型,后者只是多想想。丁铎说的"优化 harness/loop"其实是第三条路:不动梯度,动脚手架。
层次一:数据闭环——最成熟,也最不像 RSI
第一个层次是数据在环里转:模型 rollout → 按可验证结果筛选成功轨迹 → 混入下一轮 SFT/RL 训练 → 模型变强 → 再 rollout。本周谈 LoopTool 时见过这个形态(评估发现弱点 → 定向合成数据 → 再训练),工业界更完整的例子是 WebSailor 系列(arXiv:2507.02592,V2 版 2509.13305 明确把合成数据 + 可扩展 RL 写进标题):用强模型造浏览轨迹、用结果奖励训练、用自我批评过滤、再自动合成更难的训练任务。DeepResearcher(2504.03160)报告了一个值得记住的现象:这类闭环训练里,预搜索规划、信息分层、交叉验证这些行为没有被任何奖励项显式鼓励,是 RL 优化的副产品。
这个层次已经工业化,但严格说它不是"自我"改进——闭环里做选择的是工程师设计的筛选器,模型只是数据源。它的天花板也很清楚:筛选标准本身是可 hack 的(“碰巧成功"的低效轨迹会被留下),而且数据分布越窄,闭环转得越快,模型越快地把自己收敛到当前验证器喜欢的样子。
层次二:奖励闭环——RLSVR 想把自验证红利扩展到开放任务
第二个层次是奖励在环里转。RLVR 过去两年的成功建立在"数学和代码有确定性验证器"上;开放式任务(写作、研究、对话)没有验证器,只能靠偏好模型或 LLM 判官,于是有评测偏差、判官能力瓶颈、推理成本三重税。RLSVR(arXiv:2607.23802)的思路是从自监督学习借"pretext task"的概念:把开放任务做任务变换,变换出一个能自验证的形式,让奖励重新来自任务本身而不是外部判官。
这个思路的成立条件值得摊开:它要求任务存在某种保真变换(变换后的任务做对了≈原任务做得好),并且验证器在变换后空间里是确定性的。论文标题里的"task transformation induces self-verifiable rewards"说的就是诱导这一步。如果成立,开放式任务也能接上 RLVR 的工业化红利;如果不成立——变换损失太大,自验证奖励就是在优化一个与原任务脱节的代理指标。
对闭环的意义:奖励闭环是三个层次里对 RSI 最关键的一层。数据闭环的筛选器、系统闭环的评测器,都要回答"什么算变好”,而自验证奖励是目前唯一不依赖人类持续供给的答案。
层次三:系统闭环——RSI 的本体,卡在监督上
第三个层次才是 RSI 的本体:模型(或其产物)改进用于改进它的东西——更好的助手、更好的数据、更好的评测——形成递归。2018 年 Leike 等人的奖励建模研究纲领(arXiv:1811.07871)里就有一节明确讨论递归奖励建模:用 AI 帮助人类评估 AI 的输出,评估能力随被评估者一起涨。
这个层次的前置条件是 scalable oversight(2211.03592,教材第 30 章引为对齐核心方向):当模型能力超过人类评估能力,谁来验收改进是真的?闭环里每一轮都在做选择,选择标准一旦可 hack,闭环转速越快,崩得越快——数据闭环里已经能看到小尺度版本(指标通胀),系统闭环把它放大到全流程。这也是为什么"证明持续学到的是可迁移能力"是丁铎列出的硬问题:闭环内的提升常常是"在这个闭环的评测里变强",出了闭环未必。
三个层次共用一张考卷
把三个层次放在一起,丁铎的三个硬问题可以各自落到具体机制上:
- 成本:数据闭环的成本是 rollout 和筛选(每轮迭代都全量采样,前面算过 rollout = prompt × G 的账);奖励闭环的成本是变换器和验证器的构造与维护;系统闭环的成本目前基本无法估计——因为还没有跑通过全流程的实例。
- 参数污染:只有层次三涉及。持续梯度更新让新知识干扰旧能力,且污染随迭代轮数累积——这是"不改权重"路线当前被低估的原因之一:harness 和 loop 的优化不会污染参数,收益立等可取, DeepSeek V3.2 这类工程(验证器自加、采样器换 mHC)都是这一路线的兑现。
- 可迁移性:三个层次都没有好的评测协议。闭环内部的评测被闭环本身污染(训练目标和评测目标同源),跨闭环的评测又太贵。
我的三个判断
一、“不改权重"路线是当前 RSI 的主要兑现形式,而且被理论界低估了。 Scaffold 优化(工具、上下文工程、验证器内化、采样流程)不改参数、不污染权重、可回滚,单位算力的收益在当前阶段高于直接改权重。把它开除出"自我改进"的籍,是术语洁癖造成的资源误配。
二、三个层次的瓶颈不在同一处。数据闭环卡在筛选器的可 hack 性;奖励闭环卡在任务变换的保真度;系统闭环卡在监督(scalable oversight 没有解,递归就只能是递归地自欺)。讨论"RSI 进展"时不指明层次,结论必然含糊。
三、闭环速度是双刃剑,而且是安全问题的放大器。每篇谈 self-improvement 的论文都在讲收敛速度,很少同时讲失控速度;但两者的结构是同一个——闭环把"小的选择偏差"复利化。对自我改进系统,监控的应该是闭环内指标与闭环外指标的剪刀差,而不是任何单一指标。
未决问题
- 开放式任务的任务变换是否存在系统性的构造方法(而不是逐任务手调),RLSVR 只给出了范式;
- “不改权重"路线的能力天花板在哪——是否存在只有改权重才能获得的 capability,目前还没有干净的证据;
- 跨闭环的可迁移性评测协议:谁来评、用什么数据、如何避免评测被任何一层闭环污染。
参考来源
- 丁铎对谈笔记:《在模型持续进步的时代,创业者应该站在哪里》§20(RSI 与持续学习的两条路线、三个硬问题),
/Users/moonshot/Documents/thinking/ - RLSVR:arXiv:2607.23802(摘要与核心主张)
- WebSailor:arXiv:2507.02592、V2 2509.13305(标题与系列定位);DeepResearcher arXiv:2504.03160
- 递归奖励建模:Leike et al. arXiv:1811.07871;Scalable Oversight arXiv:2211.03592(本地教材
docs/chapter30_alignment_failures/scaling-and-defenses.md) - Test-Time Training 经典:Sun et al. arXiv:2007.12880;test-time scaling:s1 arXiv:2501.19393
- 前篇:7 轮交互失败了该怪谁:多轮轨迹的奖励归因(昨天:局内归因;今天:跨局闭环)