<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Post-Training on Njx&#39;Log</title>
    <link>https://njx-njx.github.io/tags/post-training/</link>
    <description>Recent content in Post-Training on Njx&#39;Log</description>
    <image>
      <title>Njx&#39;Log</title>
      <url>https://njx-njx.github.io/blog-cover.jpg</url>
      <link>https://njx-njx.github.io/blog-cover.jpg</link>
    </image>
    <generator>Hugo -- 0.161.1</generator>
    <language>zh</language>
    <lastBuildDate>Tue, 01 Sep 2026 12:30:00 +0800</lastBuildDate>
    <atom:link href="https://njx-njx.github.io/tags/post-training/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>「模型自己把自己练强」：RSI 与三个闭环</title>
      <link>https://njx-njx.github.io/posts/rsi-self-improvement-loops/</link>
      <pubDate>Tue, 01 Sep 2026 12:30:00 +0800</pubDate>
      <guid>https://njx-njx.github.io/posts/rsi-self-improvement-loops/</guid>
      <description>RSI（递归自我改进）这个词在 2025-2026 年重新变热，但它指的东西经常被混为一谈。本文按从业者的两分法（改 harness 不改权重 vs 直接改权重）切入，把「自我改进」拆成数据闭环、奖励闭环、系统闭环三个层次，各自的成立条件、兑现程度和失效模式并不相同。</description>
    </item>
    <item>
      <title>7 轮交互失败了该怪谁：奖励归因怎么进 GRPO/GSPO</title>
      <link>https://njx-njx.github.io/posts/turn-level-reward-credit-assignment/</link>
      <pubDate>Mon, 31 Aug 2026 12:55:00 +0800</pubDate>
      <guid>https://njx-njx.github.io/posts/turn-level-reward-credit-assignment/</guid>
      <description>单轮 RL 里 advantage 整条序列共享，从没人为难过；到了多轮 agentic RL，同一条轨迹里第 1 轮搜索做对了、第 2 轮 query 跑偏、最后答错——单一 trajectory reward 该怎么分摊，变成一个真实的设计决策。本文拆解形式化层（action mask、轨迹概率）、归因谱系（ORM/PRM/turn 折扣/三条中间路线）、以及 GSPO-token 为多轮留的那个口子。</description>
    </item>
    <item>
      <title>截断的回答该怎么判：DAPO Overlong 在修什么</title>
      <link>https://njx-njx.github.io/posts/dapo-overlong-reward-shaping/</link>
      <pubDate>Sun, 30 Aug 2026 12:05:00 +0800</pubDate>
      <guid>https://njx-njx.github.io/posts/dapo-overlong-reward-shaping/</guid>
      <description>RL 训练必须有生成长度上限，被截断的回答默认按答错处理——这会把“无法判定”的样本错判成“错”样本，把奖励噪声直接注入组内 advantage。DAPO 的两个方案：Overlong Filtering 承认不可判定、屏蔽其 loss；Soft Overlong Punishment 在悬崖前修一段线性缓冲坡，让长度控制变成连续信号。本文拆解机制、公式、配置数值，并把它和 Dr.GRPO、token-mean 拼成完整的长度问题图景。</description>
    </item>
    <item>
      <title>一票还是十票：token-mean 与 sample-mean 在争什么</title>
      <link>https://njx-njx.github.io/posts/token-mean-vs-sample-mean/</link>
      <pubDate>Sun, 30 Aug 2026 12:05:00 +0800</pubDate>
      <guid>https://njx-njx.github.io/posts/token-mean-vs-sample-mean/</guid>
      <description>同一个 batch 里，500 token 的回答和 5000 token 的回答，谁对梯度的贡献大？GRPO 说一样大，DAPO 说长的大十倍，两家都能给出理由。这是损失聚合方式之争——sample-mean 每条回答一票，token-mean 每个 token 一票。DAPO 论文 §3.3 说长 CoT 场景必须换 token 级，但换完会把长度倾斜从 response 级赶到 question 级。本文拆解三个公式、两家的论证和一个少有人讲的 tradeoff。</description>
    </item>
    <item>
      <title>“答错就写长一点”：GRPO 归一化项在扭曲什么</title>
      <link>https://njx-njx.github.io/posts/dr-grpo-length-and-difficulty-bias/</link>
      <pubDate>Sat, 29 Aug 2026 12:05:00 +0800</pubDate>
      <guid>https://njx-njx.github.io/posts/dr-grpo-length-and-difficulty-bias/</guid>
      <description>R1-Zero 的‘长度与奖励齐涨’被当成了推理涌现的标志性曲线，Sea AI Lab 的 Dr.GRPO 论文指出其中一半涨幅可能是优化器自己的偏好：1/|y| 让模型在答错时倾向于写长，除以 std 让极端难度的题拿走更多权重。两个归一化项、两种偏差的机制拆解，外加一个藏在 masked_mean 里的实现层偏差。</description>
    </item>
    <item>
      <title>一道题采几条回答：GRPO 组大小 G 买来了什么</title>
      <link>https://njx-njx.github.io/posts/grpo-group-size-tradeoffs/</link>
      <pubDate>Sat, 29 Aug 2026 12:00:00 +0800</pubDate>
      <guid>https://njx-njx.github.io/posts/grpo-group-size-tradeoffs/</guid>
      <description>DeepSeekMath 每题采 64 条回答，教学实现默认 8 条，最新论文 2 条也声称够用——同一个旋钮差出 32 倍。G 是 GRPO 唯一的 baseline 来源和最大的算力开关，它到底买来了什么？本文拆解 G 的三重身份：控制变量的样本数、有效梯度组的覆盖率、std 归一化的分母质量，以及动态采样为什么能用过滤代替加大 G。</description>
    </item>
    <item>
      <title>解剖极简 SFT 训练器：每个决策，教科书和框架怎么说</title>
      <link>https://njx-njx.github.io/posts/forge-sft-anatomy/</link>
      <pubDate>Fri, 28 Aug 2026 20:12:53 +0800</pubDate>
      <guid>https://njx-njx.github.io/posts/forge-sft-anatomy/</guid>
      <description>TRL 的 SFTTrainer 一行就能训，为什么还有人手写 SFT 循环？我把 forge 仓库 Stage 1 的每个决策（chat template、prompt masking、collate 与 loss、bf16、LR schedule、数据、验证）逐一摆到台面上，对照两套教材（rlhf-book、hands-on-modern-rl）、四个生产框架（alignment-handbook、trl、open-instruct、OpenRLHF）和六路信息源：哪些决策有共识，哪些有真实的配方之争，哪些两本教材各自糊弄过去了。</description>
    </item>
    <item>
      <title>同一个模型，两个概率：训练推理不一致的代价</title>
      <link>https://njx-njx.github.io/posts/tis-train-inference-mismatch/</link>
      <pubDate>Thu, 27 Aug 2026 13:00:00 +0800</pubDate>
      <guid>https://njx-njx.github.io/posts/tis-train-inference-mismatch/</guid>
      <description>rollout 用推理引擎、训练用训练引擎，同一个模型在两边的数值对不上：实际采样的分布与你假设的策略存在偏差，名义上的 on-policy 悄悄变成 off-policy。本文拆解差异来源、有偏梯度与部署差距两个后果、算法补丁谱系，以及 Sea AI Lab 归到 BF16 精度上的根源结论。</description>
    </item>
    <item>
      <title>比率用错了单位：GSPO 把重要性采样提到序列级</title>
      <link>https://njx-njx.github.io/posts/gspo-sequence-level-importance-sampling/</link>
      <pubDate>Wed, 26 Aug 2026 17:40:00 +0800</pubDate>
      <guid>https://njx-njx.github.io/posts/gspo-sequence-level-importance-sampling/</guid>
      <description>GRPO 沿用 PPO 的 token 级重要性比率，Qwen 团队认定这是对重要性采样的根本误用，会在 MoE 长回答训练中导致不可逆崩溃。GSPO 把比率、裁剪、优化全部提到序列级，被裁掉的 token 多两个数量级，训练反而更高效。本文拆解这条论证链，以及论文没点破的前提与代价。</description>
    </item>
    <item>
      <title>熵是怎么塌掉的：DAPO 的 Clip-Higher 在修什么</title>
      <link>https://njx-njx.github.io/posts/dapo-clip-higher-entropy-collapse/</link>
      <pubDate>Wed, 26 Aug 2026 14:30:00 +0800</pubDate>
      <guid>https://njx-njx.github.io/posts/dapo-clip-higher-entropy-collapse/</guid>
      <description>naive GRPO 复现 R1 时熵快速坍缩、组内样本趋同，DAPO 的 Clip-Higher 只把裁剪上界从 0.2 抬到 0.28。这一个数背后，是 PPO-Clip 在概率轴上的结构性不对称。本文拆解失效链条、机制、证据与边界。</description>
    </item>
  </channel>
</rss>
