7 轮交互失败了该怪谁:奖励归因怎么进 GRPO/GSPO
八月 31, 2026 · 9 分钟 · 4035 字 · njx
截断的回答该怎么判:DAPO Overlong 在修什么
八月 30, 2026 · 7 分钟 · 3177 字 · njx
一票还是十票:token-mean 与 sample-mean 在争什么
八月 30, 2026 · 7 分钟 · 3216 字 · njx
“答错就写长一点”:GRPO 归一化项在扭曲什么
八月 29, 2026 · 8 分钟 · 3686 字 · njx
一道题采几条回答:GRPO 组大小 G 买来了什么
八月 29, 2026 · 9 分钟 · 4234 字 · njx
解剖极简 SFT 训练器:每个决策,教科书和框架怎么说
八月 28, 2026 · 13 分钟 · 6418 字 · njx
同一个模型,两个概率:训练推理不一致的代价
八月 27, 2026 · 9 分钟 · 4123 字 · njx
比率用错了单位:GSPO 把重要性采样提到序列级
八月 26, 2026 · 11 分钟 · 5505 字 · njx
熵是怎么塌掉的:DAPO 的 Clip-Higher 在修什么
八月 26, 2026 · 15 分钟 · 7292 字 · njx