Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-07-15
缺陷修复 重要性 4.22 洞察度 2.00

修复 gen_batch_size 缺失时 fallback 行为

建议快速合入。变更微小且正确,无潜在副作用。对于开发者而言,理解 Python 中 `dict.get` 默认值与 `or` 运算符的差别是一个值得注意的常见陷阱,可作为团队内的小知识点分享。

缺陷修复 重要性 7.30 洞察度 7.00

修复 LoRA merge 时权重同步的陈旧权重 bug

推荐精读。此 PR 展示了在 PyTorch FSDP 环境中处理上下文管理器和张量生命周期的典型陷阱,`_merged_lora_per_tensor_param` 的设计模式(生成器 + try/finally 确保 offload)值得在类似同步场景中复用。

文档 重要性 5.56 洞察度 3.00

重构 Ascend profiling 文档,添加快速开始并优化细粒度采集说明

此 PR 适合需要深入使用 Ascend profiling 功能的用户阅读,可快速掌握配置方法。但应注意 review 中提出的问题可能残留,建议在本地测试文档示例的正确性。合并者可能认为文档已足够好,但后续跟进清理遗留问题将进一步提升质量。

#6680 [tool] feat: verl add rl insight

原始 PR · 作者 mengchengTang · 合并时间 2026-07-15 14:41

功能 重要性 8.62 洞察度 6.00

集成RL-Insight可观测性框架

该 PR 适合精读,特别是 `RLInsightLogger` 的设计体现低入侵集成思路:通过环境变量跨进程传播状态、惰性初始化、统一门控。`DistProfiler.annotate` 的改造展示了多个 profiling 框架如何共存。测试覆盖了门控和并发场景,值得参考。

功能 重要性 5.85 洞察度 4.00

新增 Ascend NPU 上 Qwen3.5-35B Megatron GRPO 夜间 CI 测试

建议在后续 PR 中验证 EP 配置的正确性,或通过环境变量覆盖避免硬编码。同时可考虑将日志目录改为 `$HOME` 以提升脚本可移植性。整体而言,该 PR 作为 CI 基础设施扩展,设计简洁,适合作为同类测试的模板。

#7035 [ci] test: update ascend ci docker tag

原始 PR · 作者 yyyy2000 · 合并时间 2026-07-15 10:02

基础设施 重要性 5.24 洞察度 3.00

更新Ascend CI Docker镜像标签并移除旧Qwen3.5构建工作流

### 建议 1. **立即修复shell脚本**:将 `enforce_eager` 改回 `True`,并移除 `cudagraph_mode` 配置,以保持与Ascend NPU的兼容性。 2. **验证CI新镜像**:检查所有更新标签后的CI工作流是否正常运行,尤其是nightly和e2e测试。 3. **关注讨论中的未解决意见**:虽然PR已合并,但留下了一个已知问题,建议在后续PR中解决。

缺陷修复 重要性 3.99 洞察度 3.00

降低权重同步桶大小和 GPU 显存占比,修复 OOM

该 PR 是典型的运行时显存调优,无复杂逻辑变更,可作为全异步训练 OOM 问题的参考案例;若你也在 Ascend 上跑全异步训练,建议同步此调整。

参与讨论