Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-06-02
缺陷修复 重要性 5.17 洞察度 5.00

重置 vLLM 多模态和编码器缓存

值得阅读。本 PR 修复了多模态 rollout 中一个实用的缓存一致性 Bug,设计上通过扩展现有方法而非引入新入口点,保持了架构整洁。虽然版本检查方式有争议,但当前实现对于已知 vLLM 版本是安全的。

测试 重要性 6.13 洞察度 3.00

替换 Qwen2.5 CI 测试为 Qwen3 并添加基线验证

如果关注 NPU CI 的演进和模型升级策略,可以快速浏览该 PR。但在 shell 脚本质量方面参考价值有限(未采纳自动化建议)。建议后续修复硬编码路径问题。

2026-06-01
缺陷修复 重要性 7.01 洞察度 6.00

修复 Megatron ref 模型 GPU 显存泄漏

建议精读该 PR,特别是 `_can_safely_resize_storage` 函数的逻辑和同步拷贝 + `resize_(0)` 的使用模式。该修复对于避免大模型训练中的显存泄漏至关重要。但建议补充单元测试覆盖非 DDP 路径的卸载场景。

#6550 [ci] fix: FSDP actor/critic ci fail

原始 PR · 作者 wuxibin89 · 合并时间 2026-06-01 11:02

缺陷修复 重要性 5.05 洞察度 2.00

FSDP actor/critic CI 配置校验修复

该 PR 改动极小且直接,可快速合入以修复 CI。但 review 中提出的 `model_config` 类型兼容性问题值得在后续迭代中修复,以增强鲁棒性。

参与讨论