Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 18:49 同步状态:空闲 下次计划:2026-09-01 19:49

PR 列表

更多筛选
2026-05-14
缺陷修复 重要性 7.88 洞察度 5.00

修复FSDP NO_PADDING路径下attention mask使用response-only loss_mask的bug

建议精读。该 PR 清晰展示了如何通过 `input_ids.offsets().diff()` 从 jagged tensor 获取序列长度并正确构建 attention mask,测试设计也值得借鉴(显式对比旧行为与新行为,并验证下游形状契约)。

#6339 [doc] chore: add npu advanced features

原始 PR · 作者 wucong25 · 合并时间 2026-05-14 17:06

文档 重要性 3.83 洞察度 3.00

新增 NPU 高级特性指南文档并重组结构

该 PR 值得 Ascend NPU 用户精读,尤其关注 SGLang 和 Megatron 的参数配置表格。对于团队内部,应重视 review 中发现的配置错误,确保未来参考示例的正确性。

功能 重要性 6.40 洞察度 5.00

同步 Trainer 支持 ReMax 算法

该 PR 在同步 trainer 中成功集成了 ReMax 算法,设计清晰,值得精读以了解如何通过贪心基线注入实现 variance reduction。但 PR 中已指出两个潜在问题(KeyError 和多轮奖励),建议在使用 ReMax 时注意检查多轮 reward 场景,并考虑加强 baseline 获取的健壮性。

文档 重要性 5.06 洞察度 3.00

拆分 Ascend 安装与快速启动文档

本 PR 为文档重构,建议用户查阅新版文档以获取最新安装指导。对于开发者,可关注文档结构和版本表的维护方式。

缺陷修复 重要性 7.05 洞察度 5.00

放宽 FSDP wrap 层名解析,支持部分缺失

此 PR 修复了一个真实阻碍训练的问题,代码简洁,测试覆盖良好,推荐集成。但建议在新 PR 中跟进 reviewer 提出的字符串类型归一化建议,以确保从配置文件传入字符串时的鲁棒性。

缺陷修复 重要性 7.22 洞察度 6.00

修复 FSDP 保存检查点时 tied weights 重复导致的加载错误

值得精读,尤其是理解 FSDP 与 Hugging Face transformers 检查点互操作的深层坑点。建议阅读 `drop_tied_target_keys` 实现和 review 讨论中关于 identity 检测与不变式维护的权衡。考虑为核心逻辑添加单元测试。

参与讨论