「模型自己把自己练强」:RSI 与三个闭环
RSI(递归自我改进)这个词在 2025-2026 年重新变热,但它指的东西经常被混为一谈。本文按从业者的两分法(改 harness 不改权重 vs 直接改权重)切入,把「自我改进」拆成数据闭环、奖励闭环、系统闭环三个层次,各自的成立条件、兑现程度和失效模式并不相同。
7 轮交互失败了该怪谁:奖励归因怎么进 GRPO/GSPO
单轮 RL 里 advantage 整条序列共享,从没人为难过;到了多轮 agentic RL,同一条轨迹里第 1 轮搜索做对了、第 2 轮 query 跑偏、最后答错——单一 trajectory reward 该怎么分摊,变成一个真实的设计决策。本文拆解形式化层(action mask、轨迹概率)、归因谱系(ORM/PRM/turn 折扣/三条中间路线)、以及 GSPO-token 为多轮留的那个口子。
截断的回答该怎么判:DAPO Overlong 在修什么
RL 训练必须有生成长度上限,被截断的回答默认按答错处理——这会把“无法判定”的样本错判成“错”样本,把奖励噪声直接注入组内 advantage。DAPO 的两个方案:Overlong Filtering 承认不可判定、屏蔽其 loss;Soft Overlong Punishment 在悬崖前修一段线性缓冲坡,让长度控制变成连续信号。本文拆解机制、公式、配置数值,并把它和 Dr.GRPO、token-mean 拼成完整的长度问题图景。
一票还是十票:token-mean 与 sample-mean 在争什么
同一个 batch 里,500 token 的回答和 5000 token 的回答,谁对梯度的贡献大?GRPO 说一样大,DAPO 说长的大十倍,两家都能给出理由。这是损失聚合方式之争——sample-mean 每条回答一票,token-mean 每个 token 一票。DAPO 论文 §3.3 说长 CoT 场景必须换 token 级,但换完会把长度倾斜从 response 级赶到 question 级。本文拆解三个公式、两家的论证和一个少有人讲的 tradeoff。
“答错就写长一点”:GRPO 归一化项在扭曲什么
R1-Zero 的‘长度与奖励齐涨’被当成了推理涌现的标志性曲线,Sea AI Lab 的 Dr.GRPO 论文指出其中一半涨幅可能是优化器自己的偏好:1/|y| 让模型在答错时倾向于写长,除以 std 让极端难度的题拿走更多权重。两个归一化项、两种偏差的机制拆解,外加一个藏在 masked_mean 里的实现层偏差。
一道题采几条回答:GRPO 组大小 G 买来了什么
DeepSeekMath 每题采 64 条回答,教学实现默认 8 条,最新论文 2 条也声称够用——同一个旋钮差出 32 倍。G 是 GRPO 唯一的 baseline 来源和最大的算力开关,它到底买来了什么?本文拆解 G 的三重身份:控制变量的样本数、有效梯度组的覆盖率、std 归一化的分母质量,以及动态采样为什么能用过滤代替加大 G。
解剖极简 SFT 训练器:每个决策,教科书和框架怎么说
TRL 的 SFTTrainer 一行就能训,为什么还有人手写 SFT 循环?我把 forge 仓库 Stage 1 的每个决策(chat template、prompt masking、collate 与 loss、bf16、LR schedule、数据、验证)逐一摆到台面上,对照两套教材(rlhf-book、hands-on-modern-rl)、四个生产框架(alignment-handbook、trl、open-instruct、OpenRLHF)和六路信息源:哪些决策有共识,哪些有真实的配方之争,哪些两本教材各自糊弄过去了。
同一个模型,两个概率:训练推理不一致的代价
rollout 用推理引擎、训练用训练引擎,同一个模型在两边的数值对不上:实际采样的分布与你假设的策略存在偏差,名义上的 on-policy 悄悄变成 off-policy。本文拆解差异来源、有偏梯度与部署差距两个后果、算法补丁谱系,以及 Sea AI Lab 归到 BF16 精度上的根源结论。
比率用错了单位:GSPO 把重要性采样提到序列级
GRPO 沿用 PPO 的 token 级重要性比率,Qwen 团队认定这是对重要性采样的根本误用,会在 MoE 长回答训练中导致不可逆崩溃。GSPO 把比率、裁剪、优化全部提到序列级,被裁掉的 token 多两个数量级,训练反而更高效。本文拆解这条论证链,以及论文没点破的前提与代价。
熵是怎么塌掉的:DAPO 的 Clip-Higher 在修什么
naive GRPO 复现 R1 时熵快速坍缩、组内样本趋同,DAPO 的 Clip-Higher 只把裁剪上界从 0.2 抬到 0.28。这一个数背后,是 PPO-Clip 在概率轴上的结构性不对称。本文拆解失效链条、机制、证据与边界。