「模型自己把自己练强」:RSI 与三个闭环

RSI(递归自我改进)这个词在 2025-2026 年重新变热,但它指的东西经常被混为一谈。本文按从业者的两分法(改 harness 不改权重 vs 直接改权重)切入,把「自我改进」拆成数据闭环、奖励闭环、系统闭环三个层次,各自的成立条件、兑现程度和失效模式并不相同。

九月 1, 2026 · 7 分钟 · 3121 字 · njx

7 轮交互失败了该怪谁:奖励归因怎么进 GRPO/GSPO

单轮 RL 里 advantage 整条序列共享,从没人为难过;到了多轮 agentic RL,同一条轨迹里第 1 轮搜索做对了、第 2 轮 query 跑偏、最后答错——单一 trajectory reward 该怎么分摊,变成一个真实的设计决策。本文拆解形式化层(action mask、轨迹概率)、归因谱系(ORM/PRM/turn 折扣/三条中间路线)、以及 GSPO-token 为多轮留的那个口子。

八月 31, 2026 · 9 分钟 · 4035 字 · njx

Agentic RL: The Long Shadow of Feedback

A field note on agentic RL: reward design, behavior shaping, credit assignment, online and offline evaluation, and the feedback loops behind agents.

五月 22, 2026 · 4 分钟 · 749 字 · njx