「模型自己把自己练强」:RSI 与三个闭环

RSI 与自我改进的层次:数据闭环、奖励闭环、系统闭环——各自的成立条件、兑现程度和失效模式并不相同。

九月 1, 2026

7 轮交互失败了该怪谁:奖励归因怎么进 GRPO/GSPO

多轮 agentic RL 的奖励归因:轨迹概率、三层信号、ORM/PRM 对照实验、三条中间路线、turn-level 反向折扣,以及 GSPO-token 为多轮留的那个口子。

八月 31, 2026

一票还是十票:token-mean 与 sample-mean 在争什么

同一个 batch 里,500 token 的回答和 5000 token 的回答,谁对梯度的贡献大?GRPO 说一样大,DAPO 说长的大十倍。损失聚合方式之争:sample-mean 每条回答一票…

八月 30, 2026

截断的回答该怎么判:DAPO Overlong 在修什么

RL 训练必须有生成长度上限,被截断的回答默认按答错处理——这会把「无法判定」的样本错判成「错」样本,把奖励噪声经组内归一化放大注入训练。DAPO 的两个方案:Overlong Filtering 承…

八月 30, 2026

“答错就写长一点”:GRPO 归一化项在扭曲什么

R1-Zero 的「长度与奖励齐涨」被当成推理涌现的标志性曲线,Dr.GRPO 论文指出其中一半涨幅可能是优化器自己的偏好:1/|y| 让模型答错时倾向写长,逐题 std 让极端难度的题拿走更多权重。…

八月 29, 2026

一道题采几条回答:GRPO 组大小 G 买来了什么

DeepSeekMath 每题采 64 条回答,教学实现默认 8 条,最新论文 2 条也声称够用——同一个旋钮差出 32 倍。G 是 GRPO 唯一的 baseline 来源和最大的算力开关,它到底买…

八月 29, 2026

解剖极简 SFT 训练器:每个决策,教科书和框架怎么说

一个极简 SFT 训练器的 7 个工程决策,对照两套教材、四个生产框架与六路信息源。

八月 28, 2026

同一个模型,两个概率:训练推理不一致的代价

rollout 用推理引擎、训练用训练引擎,同一个模型在两边算出两个概率:名义上的 on-policy 悄悄变成 off-policy。本报告拆解差异来源、有偏梯度与部署差距两个后果、算法补丁谱系,以…

八月 27, 2026

比率用错了单位:GSPO 把重要性采样提到序列级

GRPO 沿用 PPO 的 token 级重要性比率,Qwen 团队认定这是对重要性采样的根本误用。GSPO 把比率、裁剪、优化全部提到序列级:被裁掉的 token 多两个数量级,训练反而更高效。

八月 26, 2026

熵是怎么塌掉的:DAPO 的 Clip-Higher 在修什么

naive GRPO 复现 R1 时熵快速坍缩,DAPO 的 Clip-Higher 只把裁剪上界从 0.2 抬到 0.28。这一个数背后,是 PPO-Clip 在概率轴上的结构性不对称。

八月 26, 2026