修复 PPO GAE 仅在可训练 token 上计算
值得精读。这是 PPO 在 agentic / 多轮场景下训练正确性的关键修复:"压缩子序列再跑 batched GAE" 的设计让 FLA 风格 chunked kernel 零改动复用,属于可迁移的模式;docstring 对 masked 位置 0 值、下游 whitening / OPD 偏移、mask-weighted 统计量的边界界定也很值得学习。建议与 PR#1916(多轮样本语义)、PR#1759(session server 样本组装)一起阅读,理解 loss_mask 从 rollout 到 loss 的完整链路。
参与讨论