对齐 Megatron 训练与 SGLang rollouts,新增确定性 GLM-5 对齐路径
值得精读。该 PR 展示了如何系统性对齐训练与推理引擎的数值行为,包含大量可借鉴的设计:自定义 autograd 函数封装外部 kernel、通过 Triton 内核实现确定性路由重排、使用直通估计器(STE)处理对齐权重、基于 cache key 的权重对齐缓存、以及通过 layerwise dump 精确验证对齐效果。对从事多后端一致性、MoE 训练、FP8 量化的工程师有很高参考价值。建议关注点:1)routing_replay 对非 GLM-5 模型的潜在影响;2)DeepEP 成为唯一对齐后端的回退策略;3)CI 门禁的 fixture 依赖管理。
参与讨论