优雅关闭 trainer 的 ReplayBuffer 轮询线程
建议尽快合并。该修复解决了训练终止时的资源泄漏和崩溃问题,对生产环境有积极意义。但 review 中提出的初始化失败场景仍需后续跟进修复,建议开一个新 issue 跟踪。
verl: Volcano Engine Reinforcement Learning for LLMs
优雅关闭 trainer 的 ReplayBuffer 轮询线程
建议尽快合并。该修复解决了训练终止时的资源泄漏和崩溃问题,对生产环境有积极意义。但 review 中提出的初始化失败场景仍需后续跟进修复,建议开一个新 issue 跟踪。
修复 VeOmni critic 加载错误模型类型
本次 PR 虽小但具有较高价值,解决了 VeOmni 后端下 PPO 训练的核心计算错误。值得关注的设计决策是 `_get_model_config_path` 钩子模式:它避免了在 `_build_model_optimizer` 中硬编码配置分支,保持了父类逻辑的完整性,让子类通过重写来定制模型配置。建议后续将 `hidden_dropout = "0"` 改为 `0.0` 以消除类型风险。
为自定义 worker 配置添加扩展点
值得精读,特别是如果正在编写自定义 TaskRunner 或需要外部管理 LLM 服务器路由。留意 extra_context 的序列化兼容性和 LLMServerClient 子类对 None load_balancer_handle 的处理。
原始 PR · 作者 Turingzero0 · 合并时间 2026-05-26 18:58
添加 top-k 蒸馏重叠诊断指标
值得精读,特别是对 on-policy 蒸馏研究和调试感兴趣的同学。设计上保持了非侵入性(不改变损失计算),在 FSDP 和 Megatron 两套引擎中实现了相同的诊断逻辑,是跨后端功能一致的范例。Megatron 中通过 all_gather 获取全局 student top-k 的方式值得注意,其 world_size=1 的保护建议虽未采纳,但可作为后续优化点。
原始 PR · 作者 tardis-key · 合并时间 2026-05-26 15:58
为 fully_async 模式添加 profiling 支持,统一步数定义
建议精读。该 PR 是 fully_async 功能完善的重要一步,其中关于 step 概念统一的设计值得关注(区分 global_steps 与 current_param_version)。代码改动集中在少数文件,逻辑清晰,适合作为异步模式下 profiling 集成的参考实现。
集成MoE负载均衡监控到VeOmni引擎
值得精读`_init_moe_monitor`和`_log_moe_metrics`的设计模式:通过外部monitor对象封装收集逻辑、利用暂停/恢复控制采集范围、以及直接通过wandb日志避免框架包装。这些决策对类似监控功能的集成有参考价值。
更新 Ascend NPU Docker 至 CANN 9.0.0
建议仔细阅读 review 中的建议,并在后续 PR 中修复遗留问题。PR 本身完成了版本升级的目标,但实施细节有瑕疵。对于使用 Ascend NPU 的开发者,应关注修复后的 Dockerfile 版本。
原始 PR · 作者 ETOgaosion · 合并时间 2026-05-25 19:31
修复 FSDP2 CPUOffloadPolicy 下 state_dict 设备不匹配崩溃
建议合并,同时尽快修复 `save_checkpoint` 的类似问题以保持代码一致性和避免后续崩溃。可参考本 PR 的守卫模式。
参与讨论