Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-05-27
缺陷修复 重要性 6.62 洞察度 5.00

优雅关闭 trainer 的 ReplayBuffer 轮询线程

建议尽快合并。该修复解决了训练终止时的资源泄漏和崩溃问题,对生产环境有积极意义。但 review 中提出的初始化失败场景仍需后续跟进修复,建议开一个新 issue 跟踪。

缺陷修复 重要性 7.25 洞察度 6.00

修复 VeOmni critic 加载错误模型类型

本次 PR 虽小但具有较高价值,解决了 VeOmni 后端下 PPO 训练的核心计算错误。值得关注的设计决策是 `_get_model_config_path` 钩子模式:它避免了在 `_build_model_optimizer` 中硬编码配置分支,保持了父类逻辑的完整性,让子类通过重写来定制模型配置。建议后续将 `hidden_dropout = "0"` 改为 `0.0` 以消除类型风险。

2026-05-26
功能 重要性 7.15 洞察度 5.00

添加 top-k 蒸馏重叠诊断指标

值得精读,特别是对 on-policy 蒸馏研究和调试感兴趣的同学。设计上保持了非侵入性(不改变损失计算),在 FSDP 和 Megatron 两套引擎中实现了相同的诊断逻辑,是跨后端功能一致的范例。Megatron 中通过 all_gather 获取全局 student top-k 的方式值得注意,其 world_size=1 的保护建议虽未采纳,但可作为后续优化点。

#6461 [fully_async] feat: fully async profiling

原始 PR · 作者 tardis-key · 合并时间 2026-05-26 15:58

功能 重要性 7.05 洞察度 6.00

为 fully_async 模式添加 profiling 支持,统一步数定义

建议精读。该 PR 是 fully_async 功能完善的重要一步,其中关于 step 概念统一的设计值得关注(区分 global_steps 与 current_param_version)。代码改动集中在少数文件,逻辑清晰,适合作为异步模式下 profiling 集成的参考实现。

功能 重要性 7.07 洞察度 6.00

集成MoE负载均衡监控到VeOmni引擎

值得精读`_init_moe_monitor`和`_log_moe_metrics`的设计模式:通过外部monitor对象封装收集逻辑、利用暂停/恢复控制采集范围、以及直接通过wandb日志避免框架包装。这些决策对类似监控功能的集成有参考价值。

#6466 [ci] chore: update npu docker to cann 9.0.0

原始 PR · 作者 yyyy2000 · 合并时间 2026-05-26 09:25

基础设施 重要性 5.46 洞察度 3.00

更新 Ascend NPU Docker 至 CANN 9.0.0

建议仔细阅读 review 中的建议,并在后续 PR 中修复遗留问题。PR 本身完成了版本升级的目标,但实施细节有瑕疵。对于使用 Ascend NPU 的开发者,应关注修复后的 Dockerfile 版本。

2026-05-25

参与讨论