Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 21:14 同步状态:空闲 下次计划:2026-09-01 22:14

PR 列表

更多筛选
2026-07-10
功能 重要性 8.96 洞察度 6.00

将 SkipManager 适配到 Trainer V1,支持 rollout TQ 批缓存与重放。

值得精读。该 PR 展示了如何将已有 SkipManager 模式扩展到新的 Trainer 架构,设计上采用装饰器模式实现了低侵入性改造,对理解 V1 Trainer 的数据流和 SkipManager 扩展机制有很好的学习价值。建议关注后续可能的重构(如统一 SkipBase 类)和 CI 集成。

功能 重要性 6.12 洞察度 4.00

添加 HY V3 Megatron GRPO 训练示例与 FLOPs 估算

该 PR 提供了实用的模型支持,值得用户参考。但应留意 `use_mbridge` 的过时问题,建议尽快为 FLOPs 估算函数补充单元测试,并在后续迭代中迁移至原生 Megatron-Bridge 配置。

缺陷修复 重要性 1.35 洞察度 1.00

修正 A5 安装文档中 vLLM-Ascend 的 cherry-pick commit hash

该 PR 是典型的 bugfix 文档更新,价值在于确保安装指南的准确性。对于一般读者无需特别关注,但对于 A5 平台的用户具有实际指导意义。

2026-07-09

#6993 [veomni] fix: use default moe param handler

原始 PR · 作者 wuxibin89 · 合并时间 2026-07-09 20:04

缺陷修复 重要性 6.09 洞察度 4.00

统一 VeOmni MoE 参数处理为默认 fallback

建议合并。该 PR 修复了一个 MoE 参数处理的缺陷,使 VeOmni 引擎能自动处理所有模型的 `gate_up_proj` 拆分,消除了对显式注册的依赖。虽然改动小(仅 2 个文件 5 行增加 7 行删除),但修复逻辑清晰,风险低。

缺陷修复 重要性 5.04 洞察度 3.00

规避 vLLM 多模态缓存问题并新增 Qwen3.5 397B 支持

该 PR 为示例配置与文档更新,适合在 Ascend NPU 上部署 Qwen3.5 模型的用户参考。建议精读新脚本中的并行度选择、MoE 通信策略(`alltoall`)和张量归一化(`use_naive_l2norm`)的设置,理解超大模型训练的资源分配方式。

参与讨论