快照 TopK 捕获输出,修复 overlap 下异步拷贝竞态
值得精读,虽然只有 3 行核心改动,但它揭示了一类典型的 CUDA 异步并发问题:`record_stream` 与数据快照是两种不同层次的保护手段。建议阅读 `on_forward_end` 的两个路径,理解 overlap 模式下的数据流;同时建议后续把 PR body 提到的 `test_state_capturer.py` 补回仓库,并考虑在 RL CI 中覆盖 `no_copy_to_cpu` 路径,防止竞态回归。
标签列表
聚合结果
快照 TopK 捕获输出,修复 overlap 下异步拷贝竞态
值得精读,虽然只有 3 行核心改动,但它揭示了一类典型的 CUDA 异步并发问题:`record_stream` 与数据快照是两种不同层次的保护手段。建议阅读 `on_forward_end` 的两个路径,理解 overlap 模式下的数据流;同时建议后续把 PR body 提到的 `test_state_capturer.py` 补回仓库,并考虑在 RL CI 中覆盖 `no_copy_to_cpu` 路径,防止竞态回归。
weight checker 跳过 cos/sin 旋转缓存比较
该 PR 改动极小、逻辑直白,适合作为工具类修复的快速阅读示例,不必精读。值得关注的唯一设计决策是采用基于命名子串的跳过方式,而不是更精确的类型或来源判断,这可能在将来引入漏检风险;若后续继续演进 weight checker,建议考虑白名单或 metadata 标记机制。
支持 FlashInfer TRT-LLM NVFP4 MoE 权重检查
此 PR 改动小、逻辑正确、已通过验证,值得合并。对于关注 RL 训练流程或 NVFP4 MoE 的工程师,可精读 `weight_checker_comparator.py` 中的条件分支逻辑,了解如何为不同量化后端适配权重检查。
修复 MXFP8 MoE 权重更新后 GPU 缓存索引脏数据问题
值得精读。该 PR 揭示了 GPU 缓存与动态权重卸载之间的典型交互问题,修复方案简洁但覆盖面完整。review 中关于性能权衡的讨论对设计类似缓存失效策略有参考价值。