2026  17

九月  1

「模型自己把自己练强」:RSI 与三个闭环

九月 1, 2026 · 7 分钟 · 3121 字 · njx

八月  9

7 轮交互失败了该怪谁:奖励归因怎么进 GRPO/GSPO

八月 31, 2026 · 9 分钟 · 4035 字 · njx

截断的回答该怎么判:DAPO Overlong 在修什么

八月 30, 2026 · 7 分钟 · 3177 字 · njx

一票还是十票:token-mean 与 sample-mean 在争什么

八月 30, 2026 · 7 分钟 · 3216 字 · njx

“答错就写长一点”:GRPO 归一化项在扭曲什么

八月 29, 2026 · 8 分钟 · 3686 字 · njx

一道题采几条回答:GRPO 组大小 G 买来了什么

八月 29, 2026 · 9 分钟 · 4234 字 · njx

解剖极简 SFT 训练器:每个决策,教科书和框架怎么说

八月 28, 2026 · 13 分钟 · 6418 字 · njx

同一个模型,两个概率:训练推理不一致的代价

八月 27, 2026 · 9 分钟 · 4123 字 · njx

比率用错了单位:GSPO 把重要性采样提到序列级

八月 26, 2026 · 11 分钟 · 5505 字 · njx

熵是怎么塌掉的:DAPO 的 Clip-Higher 在修什么

八月 26, 2026 · 15 分钟 · 7292 字 · njx

五月  5

Product Evals: A Travel Planner Taste Test

五月 22, 2026 · 4 分钟 · 664 字 · njx

Context Engineering: The Shape of Evidence

五月 22, 2026 · 3 分钟 · 637 字 · njx

Agentic RL: The Long Shadow of Feedback

五月 22, 2026 · 4 分钟 · 749 字 · njx

Evals As Instruments: What Demos Hide

五月 22, 2026 · 4 分钟 · 729 字 · njx

Agent Design: Loops, Tools, and Memory

五月 22, 2026 · 4 分钟 · 747 字 · njx

二月  1

Building Njx’Log: Hugo, PaperMod, GitHub Pages

二月 7, 2026 · 2 分钟 · 340 字 · njx

一月  1

Hello World

一月 27, 2026 · 1 分钟 · 74 字 · njx