修复 gen_batch_size 缺失时 fallback 行为
建议快速合入。变更微小且正确,无潜在副作用。对于开发者而言,理解 Python 中 `dict.get` 默认值与 `or` 运算符的差别是一个值得注意的常见陷阱,可作为团队内的小知识点分享。
verl: Volcano Engine Reinforcement Learning for LLMs
修复 gen_batch_size 缺失时 fallback 行为
建议快速合入。变更微小且正确,无潜在副作用。对于开发者而言,理解 Python 中 `dict.get` 默认值与 `or` 运算符的差别是一个值得注意的常见陷阱,可作为团队内的小知识点分享。
原始 PR · 作者 rongkunxue · 合并时间 2026-07-15 20:32
修复 LoRA merge 时权重同步的陈旧权重 bug
推荐精读。此 PR 展示了在 PyTorch FSDP 环境中处理上下文管理器和张量生命周期的典型陷阱,`_merged_lora_per_tensor_param` 的设计模式(生成器 + try/finally 确保 offload)值得在类似同步场景中复用。
原始 PR · 作者 zhouhengan1211 · 合并时间 2026-07-15 20:31
重构 Ascend profiling 文档,添加快速开始并优化细粒度采集说明
此 PR 适合需要深入使用 Ascend profiling 功能的用户阅读,可快速掌握配置方法。但应注意 review 中提出的问题可能残留,建议在本地测试文档示例的正确性。合并者可能认为文档已足够好,但后续跟进清理遗留问题将进一步提升质量。
原始 PR · 作者 tardis-key · 合并时间 2026-07-15 16:16
README 新增 RL-Insight 新闻条目
该 PR 为简单的文档更新,无需精读;可快速合入。
原始 PR · 作者 mengchengTang · 合并时间 2026-07-15 14:41
集成RL-Insight可观测性框架
该 PR 适合精读,特别是 `RLInsightLogger` 的设计体现低入侵集成思路:通过环境变量跨进程传播状态、惰性初始化、统一门控。`DistProfiler.annotate` 的改造展示了多个 profiling 框架如何共存。测试覆盖了门控和并发场景,值得参考。
原始 PR · 作者 chengminhua · 合并时间 2026-07-15 10:25
新增 Ascend NPU 上 Qwen3.5-35B Megatron GRPO 夜间 CI 测试
建议在后续 PR 中验证 EP 配置的正确性,或通过环境变量覆盖避免硬编码。同时可考虑将日志目录改为 `$HOME` 以提升脚本可移植性。整体而言,该 PR 作为 CI 基础设施扩展,设计简洁,适合作为同类测试的模板。
更新Ascend CI Docker镜像标签并移除旧Qwen3.5构建工作流
### 建议 1. **立即修复shell脚本**:将 `enforce_eager` 改回 `True`,并移除 `cudagraph_mode` 配置,以保持与Ascend NPU的兼容性。 2. **验证CI新镜像**:检查所有更新标签后的CI工作流是否正常运行,尤其是nightly和e2e测试。 3. **关注讨论中的未解决意见**:虽然PR已合并,但留下了一个已知问题,建议在后续PR中解决。
原始 PR · 作者 zhouhengan1211 · 合并时间 2026-07-15 09:28
降低权重同步桶大小和 GPU 显存占比,修复 OOM
该 PR 是典型的运行时显存调优,无复杂逻辑变更,可作为全异步训练 OOM 问题的参考案例;若你也在 Ascend 上跑全异步训练,建议同步此调整。
参与讨论