一票还是十票:token-mean 与 sample-mean 在争什么

同一个 batch 里,500 token 的回答和 5000 token 的回答,谁对梯度的贡献大?GRPO 说一样大,DAPO 说长的大十倍,两家都能给出理由。这是损失聚合方式之争——sample-mean 每条回答一票,token-mean 每个 token 一票。DAPO 论文 §3.3 说长 CoT 场景必须换 token 级,但换完会把长度倾斜从 response 级赶到 question 级。本文拆解三个公式、两家的论证和一个少有人讲的 tradeoff。

八月 30, 2026 · 7 分钟 · 3216 字 · njx

“答错就写长一点”:GRPO 归一化项在扭曲什么

R1-Zero 的‘长度与奖励齐涨’被当成了推理涌现的标志性曲线,Sea AI Lab 的 Dr.GRPO 论文指出其中一半涨幅可能是优化器自己的偏好:1/|y| 让模型在答错时倾向于写长,除以 std 让极端难度的题拿走更多权重。两个归一化项、两种偏差的机制拆解,外加一个藏在 masked_mean 里的实现层偏差。

八月 29, 2026 · 8 分钟 · 3686 字 · njx