Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-06-10
性能优化 重要性 7.88 洞察度 7.00

分块gather-logsumexp避免长上下文OOM

对于从事长上下文蒸馏或大型词表模型训练的开发者,本 PR 值得精读,它展示了在不牺牲数值精度前提下,通过数学恒等变形和分块计算优雅解决 OOM 问题的模式。对于 verl 核心维护者,建议关注后续 PR `_forward_skip_lm_head`,以完全消除 [B,T,V] 张量。其他人可快速了解设计权衡。

功能 重要性 6.34 洞察度 5.00

补全 VeOmni 引擎缺失配置与 Qwen3.5 算子支持

本 PR 属于 VeOmni 配置体系的规范性补全,建议普通用户阅读 `final_report_markdown` 中的配置变更摘要了解可用选项;参与 VeOmni 开发的工程师应关注 review 中关于 FSDP2-only 和算子选择约束的讨论,避免后续添加不兼容字段。

2026-06-09

#6667 [doc] feat: update Qwen3.5 NPU guide

原始 PR · 作者 zjchenn · 合并时间 2026-06-09 16:37

文档 重要性 4.32 洞察度 3.00

统一 Qwen3.5 NPU 文档,支持 35B 和 122B

建议阅读新建的统一指南 `qwen3_5_megatron_npu.md`,了解 Qwen3.5 在 Ascend NPU 上使用 Megatron+vLLM 进行 GRPO 训练的完整流程,特别是多机 Ray 集群启动参数和并行策略配置。维护者应关注 Docker 镜像和 commit 的时效性,及时更新文档中的版本号。

文档 重要性 4.51 洞察度 4.00

更新 Ascend vLLM 最佳实践文档,新增详细指南

对于希望在 Ascend 上使用 vLLM 的开发者,建议精读此文档并参考其中的脚本。对于团队维护者,该 PR 展示了文档 Review 中应关注的示例可运行性要点。

缺陷修复 重要性 8.32 洞察度 6.00

修复 FSDP 训练中 rollout 缓冲区不同步

对于从事 FSDP 与 vLLM 集成开发的工程师,此 PR 值得精读,特别是其通过拆分权重更新来安全同步缓冲区的设计模式。测试代码中使用的桩模块技巧也可作为在无硬件依赖下进行单元测试的参考。

2026-06-08
缺陷修复 重要性 6.96 洞察度 5.00

修复 vLLM ZMQ handle 在 DP>1 时的 rank 冲突

建议分布式训练工程师精读该 PR,尤其是 rank 计算逻辑。`_resolve_vllm_weight_sync_local_rank` 的 fallback 路径值得关注,建议未来增加日志以降低调试成本。

缺陷修复 重要性 7.75 洞察度 5.00

适配最新 Megatron-LM mcore,增强 MTP rollout 配置

值得精读,特别是动态签名检测和防重复打补丁的设计模式,可推广到其他需要兼容多个 API 版本的补丁场景。建议后续补充 MTP rollout 配置的单元测试,覆盖用户自定义 speculative_config 的情况。

参与讨论