比率用错了单位:GSPO 把重要性采样提到序列级
GRPO 沿用 PPO 的 token 级重要性比率,Qwen 团队认定这是对重要性采样的根本误用,会在 MoE 长回答训练中导致不可逆崩溃。GSPO 把比率、裁剪、优化全部提到序列级,被裁掉的 token 多两个数量级,训练反而更高效。本文拆解这条论证链,以及论文没点破的前提与代价。
GRPO 沿用 PPO 的 token 级重要性比率,Qwen 团队认定这是对重要性采样的根本误用,会在 MoE 长回答训练中导致不可逆崩溃。GSPO 把比率、裁剪、优化全部提到序列级,被裁掉的 token 多两个数量级,训练反而更高效。本文拆解这条论证链,以及论文没点破的前提与代价。