路线 A · 快
改 harness / loop,不改权重
- 优化脚手架:工具、上下文工程、验证器内化、采样流程
- 不改参数、不污染权重、可回滚
- 单位算力收益在当前阶段高于直接改权重
- 兑现例:DeepSeek V3.2 这类工程(验证器自加、采样器换 mHC)
当前 RSI 的主要兑现形式——但被术语洁癖低估了(判断一,§6)
POST-TRAINING RESEARCH · INTERACTIVE EDITION · 2026-09-01
RSI 与自我改进的层次:数据 · 奖励 · 系统
RSI(递归自我改进)在 2025–2026 年重新变热,但不同人说它时指的东西差别很大。本报告按从业者的两分法切入,把「自我改进」拆成三个层次——各自的成立条件、兑现程度和失效模式并不相同。点击封面上的环,逐层下钻。
出处分级:对谈 / 论文一手 / 教材 · 引用均为 arXiv 编号,可回查 K 表 · 封面三环可点击下钻,外环红色缺口 = 监督缺口
§0 · 执行摘要
数据在环里转、奖励在环里转、系统本身在环里转——三层共用一张考卷,但各自卡在不同的地方。
第一个层次是数据闭环:模型 rollout、按可验证结果筛选成功轨迹、混入下一轮训练、模型变强、再 rollout。它已经工业化,但严格说不是「自我」改进——闭环里做选择的是工程师设计的筛选器。第二个层次是奖励闭环:开放式任务没有确定性验证器,RLSVR 试图用任务变换诱导出自验证奖励,把 RLVR 的工业化红利扩展出去。第三个层次才是 RSI 的本体——系统闭环:模型改进用于改进它的东西,形成递归;它卡在 scalable oversight 上。
本报告的核心主张(详见 §6):「不改权重」路线是当前 RSI 的主要兑现形式,而且被理论界低估了;三个层次的瓶颈不在同一处;闭环速度是双刃剑,监控对象应该是闭环内指标与闭环外指标的剪刀差,而不是任何单一指标。
三层次总览:环里转什么、谁在做选择、兑现到什么程度
成熟度为定性判断(作者口径)· 每行可点击跳到对应章节
| 层次 | 环里转的是 | 谁在做选择 | 兑现程度 | 卡在哪 |
|---|
Source · 分析判断(K1 框架 + K2–K7 论文一手),blog 正文转写
证据分级与互链。本报告全部事实来自同名 blog 的忠实转写:《模型自己把自己练强,拆开看是三个闭环》(2026-09-01)。出处按 对谈 / 论文一手 / 教材 分级,登记在 §7 的 K1–K10 锚点表。姊妹报告:《7 轮交互失败了该怪谁:多轮轨迹的奖励归因》——前一篇讲局内归因,本篇讲跨局闭环。
读法声明。报告中的能力曲线与剪刀差图为概念示意(非实测数据),用于呈现机制结构;所有论文结论以 blog 转写的口径为准,未另做复核。
§1 · 路线与术语
这个词的混乱程度,和它承诺的吸引力成正比。
「RSI」(Recursive Self-Improvement)在 2025–2026 年重新变热:有人指 rollout 筛数据再训练的迭代管线,有人指模型自己改写自己的训练流程,有人指 test-time compute 的扩展。先引入一个从业者框架:Perplexity 后训练负责人丁铎在一场对谈里把 RSI 和持续学习分成两条路线,他的判断是前者更快出结果,后者可能带来更深的能力变化;两条路线共同的硬问题是三个——控制成本、避免参数污染、证明持续学到的是可迁移能力。本文后面会反复回到这三个问题上(§5 把它们落到具体机制)。
一条路线不改模型参数,优化 harness、loop 和求解流程;另一条直接更新模型权重。前者更快出结果,后者可能带来更深的能力变化。
— 丁铎,Perplexity 后训练负责人 · 对谈 §20
语境《在模型持续进步的时代,创业者应该站在哪里》§20,RSI 与持续学习的两条路线。 为什么重要两路线共同的硬问题——成本、参数污染、可迁移性——是评估任何「自我改进」主张的考卷。
丁铎两路线对照:快与深,是两条不同的兑现路径
两路线共享同一张考卷(§5)· 卡片可悬停下钻
路线 A · 快
当前 RSI 的主要兑现形式——但被术语洁癖低估了(判断一,§6)
路线 B · 深
快与深不互斥;问题是两条路线都要先交出考卷答案
Source · 丁铎对谈 §20(K1,对谈记录)+ 分析判断
经典 TTT(Test-Time Training)指的是推理时对当前输入做梯度更新;而 s1 带火的「test-time scaling」指的是延长推理链、加预算,不碰权重。LLM 语境里说「test-time 新范式」时,一定要问清指的是哪个——前者是真改模型,后者只是多想想。丁铎说的「优化 harness/loop」其实是第三条路:不动梯度,动脚手架。
Test-Time Training · Sun et al. 2020
推理时对当前输入做梯度更新——真改模型。
「Test-time」语境里最硬核的一支:权重在推理期被更新。代价是推理成本与工程复杂度。出处:arXiv:2007.12880(K8,论文一手)。
悬停看全部
Test-Time Scaling · s1, 2025
延长推理链、加预算——只是多想想,不碰权重。
s1 带火的说法:更多思考 token、更多采样预算,模型本身不变。把它和 TTT 混为一谈,会高估「test-time 新范式」对权重的触及深度。出处:arXiv:2501.19393(K9,论文一手)。
悬停看全部
脚手架优化 · 丁铎路线的第三条路
不动梯度,动工具、上下文、验证器与采样流程。
丁铎「优化 harness/loop」的兑现形式:不改参数、不污染权重、可回滚。本报告判断一认为它是当前被低估的路线。出处:丁铎对谈 §20(K1)+ 分析判断。
悬停看全部
§2 · 层次一
数据在环里转:rollout → 按可验证结果筛选成功轨迹 → 混入下一轮 SFT/RL → 模型变强 → 再 rollout。
本周谈 LoopTool 时见过这个形态(评估发现弱点 → 定向合成数据 → 再训练);工业界更完整的例子是 WebSailor 系列:用强模型造浏览轨迹、用结果奖励训练、用自我批评过滤、再自动合成更难的训练任务——V2 版(2509.13305)明确把「合成数据 + 可扩展 RL」写进标题。DeepResearcher(2504.03160)报告了一个值得记住的现象:这类闭环训练里,预搜索规划、信息分层、交叉验证这些行为没有被任何奖励项显式鼓励,是 RL 优化的副产品。
天花板与失效模式。这个层次已经工业化,但严格说它不是「自我」改进——闭环里做选择的是工程师设计的筛选器,模型只是数据源。它的天花板也很清楚:筛选标准本身是可 hack 的(「碰巧成功」的低效轨迹会被留下),而且数据分布越窄,闭环转得越快,模型越快地把自己收敛到当前验证器喜欢的样子。
对三硬问题的预登记:这一层的成本是 rollout 和筛选(每轮迭代都全量采样);它不更新权重,因此不涉及参数污染;可迁移性与其他两层一样没有好的评测协议。详见 §5 的完整考卷。
§3 · 层次二
奖励在环里转:RLVR 过去两年的成功建立在「数学和代码有确定性验证器」上;开放任务没有验证器,只能付三重税。
开放式任务(写作、研究、对话)没有验证器,只能靠偏好模型或 LLM 判官,于是有评测偏差、判官能力瓶颈、推理成本三重税。RLSVR 的思路是从自监督学习借「pretext task」的概念:把开放任务做任务变换,变换出一个能自验证的形式,让奖励重新来自任务本身而不是外部判官——论文标题「task transformation induces self-verifiable rewards」说的就是诱导这一步。
三种世界:RLVR 的红利从哪来,三重税卡在哪,RLSVR 想打通什么
按奖励来源对比 · 每格可点击下钻出处
| 奖励来源 | 验证形态 | 状态 |
|---|
Source · K2 RLSVR · K3/K4 WebSailor · 分析判断(blog 正文转写)
成立条件,值得摊开。这个思路要求任务存在某种保真变换(变换后的任务做对了 ≈ 原任务做得好),并且验证器在变换后空间里是确定性的。如果成立,开放式任务也能接上 RLVR 的工业化红利;如果不成立——变换损失太大,自验证奖励就是在优化一个与原任务脱节的代理指标。
对闭环的意义:奖励闭环是三个层次里对 RSI 最关键的一层。数据闭环的筛选器、系统闭环的评测器,都要回答「什么算变好」,而自验证奖励是目前唯一不依赖人类持续供给的答案。
§4 · 层次三
模型(或其产物)改进用于改进它的东西——更好的助手、更好的数据、更好的评测——形成递归。
2018 年 Leike 等人的奖励建模研究纲领里就有一节明确讨论递归奖励建模:用 AI 帮助人类评估 AI 的输出,评估能力随被评估者一起涨。这个层次的前置条件是 scalable oversight(2211.03592,教材第 30 章引为对齐核心方向):当模型能力超过人类评估能力,谁来验收改进是真的?闭环里每一轮都在做选择,选择标准一旦可 hack,闭环转速越快,崩得越快——数据闭环里已经能看到小尺度版本(指标通胀),系统闭环把它放大到全流程。这也是为什么「证明持续学到的是可迁移能力」是丁铎列出的硬问题:闭环内的提升常常是「在这个闭环的评测里变强」,出了闭环未必。
监控对象:剪刀差,不是单一指标。每篇谈 self-improvement 的论文都在讲收敛速度,很少同时讲失控速度;但两者的结构是同一个——闭环把「小的选择偏差」复利化。对自我改进系统,应该监控闭环内指标与闭环外指标的剪刀差。右上图是这一结构的概念示意(非实测数据)。
§5 · 共用考卷
成本、参数污染、可迁移性——三个硬问题各自落到三层次的具体机制上。
考卷矩阵:三个硬问题 × 三个层次
红斜纹 = 缺口(无法估计 / 无协议)· 每格可点击下钻
Source · 丁铎对谈 §20(K1)+ blog「三个层次共用一张考卷」节转写
两个值得停住的格子。其一,系统闭环的成本「基本无法估计」——因为还没有跑通过全流程的实例,这是缺口本身,不是保守估计。其二,参数污染只有层次三涉及:持续梯度更新让新知识干扰旧能力,且污染随迭代轮数累积——这也是「不改权重」路线当前被低估的原因之一:harness 和 loop 的优化不污染参数,收益立等可取。
可迁移性一行则全军覆没:三个层次都没有好的评测协议。闭环内部的评测被闭环本身污染(训练目标和评测目标同源),跨闭环的评测又太贵。
§6 · 判断与未决
以下是作者判断,按原文保留其承诺强度;未决问题是这张考卷上还没有答案的格子。
姊妹报告与回链。前一篇《7 轮交互失败了该怪谁:多轮轨迹的奖励归因》处理的是局内归因——一轮轨迹里奖励该记给谁;本篇处理跨局闭环——轮与轮之间模型如何把自己练强。两篇共享同一个立场:优化结构比单点技巧更值得盯着。本文的 blog 原文:njx-njx.github.io/posts/rsi-self-improvement-loops/;姊妹报告:/reports/turn-level-reward-credit-assignment/。