Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 20:03 同步状态:空闲 下次计划:2026-09-01 21:03

PR 列表

更多筛选
2026-07-08
功能 重要性 8.99 洞察度 6.00

对齐separate_async步长与同步训练,新增指标聚合

该 PR 为 BREAKING CHANGE,所有使用 separate_async 训练器的团队都应仔细审查,确认配置和步长语义变更不会破坏现有工作流。MetricsAggregator 的设计思路值得借鉴,可推广到其他异步训练场景。建议作者补充 `num_warmup_batches` 从 4 改为 1 的说明。

功能 重要性 9.18 洞察度 6.00

vLLM Prefill-Decode 分离 rollout,支持 NIXL 和 Mooncake

建议精读此 PR,特别是 ZMQ IPC 地址计算、PD role 分配逻辑和 KV Transfer Config 构建。设计上采用进程内 AsyncLLM(而非子进程+HTTP)以适应现有 `collective_rpc` 机制,值得关注。值得注意的是,当前 PD 路径在典型负载下性能低于 colocated,需要明确告知用户预期。

缺陷修复 重要性 6.61 洞察度 5.00

按 GPU 架构和引擎条件设置 CUDA_DEVICE_MAX_CONNECTIONS

建议合并此 PR,但应同步完成 review 中提出的扩展检查范围建议,将 `_uses_megatron` 覆盖到参考策略和奖励模型引擎的策略字段。同时考虑在文档或注释中说明 `get_ppo_ray_runtime_env` 的 config 参数要求,并建议其他调用入口(如单元测试、脚本)同步更新。

基础设施 重要性 4.96 洞察度 3.00

适配 Qwen3.5 到 Verl 0.8.0 Docker 容器

PR 符合发布准备目标,变更内容合理。但建议考虑优化 Git 克隆策略以加速 Docker 构建(如使用 `git init && git fetch --depth 1 <remote> <commit>` 替代 `git clone && git fetch`),并在未来避免类似低效操作。

2026-07-07
缺陷修复 重要性 7.56 洞察度 7.00

修复 Mooncake 权重同步中 magic 信号覆盖数据 buffer 导致权重损坏

该 PR 值得精读,尤其对于使用 Mooncake RDMA 多节点训练的团队。修复思路清晰(隔离 side-effect),且第二个 commit 补充的 device synchronize 是对竞态条件的必要防御,显示了作者对 GPU 异步执行模型的理解深度。

参与讨论