Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-02 20:40 同步状态:空闲 下次计划:2026-09-02 21:40

PR 列表

更多筛选
2026-05-14

#6339 [doc] chore: add npu advanced features

原始 PR · 作者 wucong25 · 合并时间 2026-05-14 17:06

文档 重要性 3.83 洞察度 3.00

新增 NPU 高级特性指南文档并重组结构

该 PR 值得 Ascend NPU 用户精读,尤其关注 SGLang 和 Megatron 的参数配置表格。对于团队内部,应重视 review 中发现的配置错误,确保未来参考示例的正确性。

功能 重要性 6.40 洞察度 5.00

同步 Trainer 支持 ReMax 算法

该 PR 在同步 trainer 中成功集成了 ReMax 算法,设计清晰,值得精读以了解如何通过贪心基线注入实现 variance reduction。但 PR 中已指出两个潜在问题(KeyError 和多轮奖励),建议在使用 ReMax 时注意检查多轮 reward 场景,并考虑加强 baseline 获取的健壮性。

文档 重要性 5.06 洞察度 3.00

拆分 Ascend 安装与快速启动文档

本 PR 为文档重构,建议用户查阅新版文档以获取最新安装指导。对于开发者,可关注文档结构和版本表的维护方式。

缺陷修复 重要性 7.05 洞察度 5.00

放宽 FSDP wrap 层名解析,支持部分缺失

此 PR 修复了一个真实阻碍训练的问题,代码简洁,测试覆盖良好,推荐集成。但建议在新 PR 中跟进 reviewer 提出的字符串类型归一化建议,以确保从配置文件传入字符串时的鲁棒性。

缺陷修复 重要性 7.22 洞察度 6.00

修复 FSDP 保存检查点时 tied weights 重复导致的加载错误

值得精读,尤其是理解 FSDP 与 Hugging Face transformers 检查点互操作的深层坑点。建议阅读 `drop_tied_target_keys` 实现和 review 讨论中关于 identity 检测与不变式维护的权衡。考虑为核心逻辑添加单元测试。

缺陷修复 重要性 8.81 洞察度 6.00

修复 fused kernels 在 Ulysses SP 下的标签滚动错误

此 PR 是重要的正确性修复,建议所有使用 fused kernels + Ulysses SP 的团队尽快合并并同步至下游分支。同时值得关注的设计决策是:由 engine 统一预滚动标签(而非在 fused forward 中重新计算),保持了单 SP 和多 SP 路径的一致性,避免了类似错误的扩散。

参与讨论