「模型自己把自己练强」:RSI 与三个闭环
RSI(递归自我改进)这个词在 2025-2026 年重新变热,但它指的东西经常被混为一谈。本文按从业者的两分法(改 harness 不改权重 vs 直接改权重)切入,把「自我改进」拆成数据闭环、奖励闭环、系统闭环三个层次,各自的成立条件、兑现程度和失效模式并不相同。
RSI(递归自我改进)这个词在 2025-2026 年重新变热,但它指的东西经常被混为一谈。本文按从业者的两分法(改 harness 不改权重 vs 直接改权重)切入,把「自我改进」拆成数据闭环、奖励闭环、系统闭环三个层次,各自的成立条件、兑现程度和失效模式并不相同。
单轮 RL 里 advantage 整条序列共享,从没人为难过;到了多轮 agentic RL,同一条轨迹里第 1 轮搜索做对了、第 2 轮 query 跑偏、最后答错——单一 trajectory reward 该怎么分摊,变成一个真实的设计决策。本文拆解形式化层(action mask、轨迹概率)、归因谱系(ORM/PRM/turn 折扣/三条中间路线)、以及 GSPO-token 为多轮留的那个口子。
A field note on agentic RL: reward design, behavior shaping, credit assignment, online and offline evaluation, and the feedback loops behind agents.