截断的回答该怎么判:DAPO Overlong 在修什么

RL 训练必须有生成长度上限,被截断的回答默认按答错处理——这会把“无法判定”的样本错判成“错”样本,把奖励噪声直接注入组内 advantage。DAPO 的两个方案:Overlong Filtering 承认不可判定、屏蔽其 loss;Soft Overlong Punishment 在悬崖前修一段线性缓冲坡,让长度控制变成连续信号。本文拆解机制、公式、配置数值,并把它和 Dr.GRPO、token-mean 拼成完整的长度问题图景。

八月 30, 2026 · 7 分钟 · 3177 字 · njx

一道题采几条回答:GRPO 组大小 G 买来了什么

DeepSeekMath 每题采 64 条回答,教学实现默认 8 条,最新论文 2 条也声称够用——同一个旋钮差出 32 倍。G 是 GRPO 唯一的 baseline 来源和最大的算力开关,它到底买来了什么?本文拆解 G 的三重身份:控制变量的样本数、有效梯度组的覆盖率、std 归一化的分母质量,以及动态采样为什么能用过滤代替加大 G。

八月 29, 2026 · 9 分钟 · 4234 字 · njx

熵是怎么塌掉的:DAPO 的 Clip-Higher 在修什么

naive GRPO 复现 R1 时熵快速坍缩、组内样本趋同,DAPO 的 Clip-Higher 只把裁剪上界从 0.2 抬到 0.28。这一个数背后,是 PPO-Clip 在概率轴上的结构性不对称。本文拆解失效链条、机制、证据与边界。

八月 26, 2026 · 15 分钟 · 7292 字 · njx