解剖极简 SFT 训练器:每个决策,教科书和框架怎么说
TRL 的 SFTTrainer 一行就能训,为什么还有人手写 SFT 循环?我把 forge 仓库 Stage 1 的每个决策(chat template、prompt masking、collate 与 loss、bf16、LR schedule、数据、验证)逐一摆到台面上,对照两套教材(rlhf-book、hands-on-modern-rl)、四个生产框架(alignment-handbook、trl、open-instruct、OpenRLHF)和六路信息源:哪些决策有共识,哪些有真实的配方之争,哪些两本教材各自糊弄过去了。