修复FSDP NO_PADDING路径下attention mask使用response-only loss_mask的bug
建议精读。该 PR 清晰展示了如何通过 `input_ids.offsets().diff()` 从 jagged tensor 获取序列长度并正确构建 attention mask,测试设计也值得借鉴(显式对比旧行为与新行为,并验证下游形状契约)。
verl: Volcano Engine Reinforcement Learning for LLMs
修复FSDP NO_PADDING路径下attention mask使用response-only loss_mask的bug
建议精读。该 PR 清晰展示了如何通过 `input_ids.offsets().diff()` 从 jagged tensor 获取序列长度并正确构建 attention mask,测试设计也值得借鉴(显式对比旧行为与新行为,并验证下游形状契约)。
修复 CI 测试中模型路径使用本地缓存
简单修复,无需精读。但体现了在 CI 测试中使用本地缓存路径的最佳实践。
原始 PR · 作者 zhouhengan1211 · 合并时间 2026-05-14 17:40
新增 NPU 模型与算法支持状态文档
值得快速浏览,尤其推荐给需要在 Ascend NPU 上选择训练配置的开发者。文档的结构可作为后续新增支持的模板。
新增 NPU 高级特性指南文档并重组结构
该 PR 值得 Ascend NPU 用户精读,尤其关注 SGLang 和 Megatron 的参数配置表格。对于团队内部,应重视 review 中发现的配置错误,确保未来参考示例的正确性。
同步 Trainer 支持 ReMax 算法
该 PR 在同步 trainer 中成功集成了 ReMax 算法,设计清晰,值得精读以了解如何通过贪心基线注入实现 variance reduction。但 PR 中已指出两个潜在问题(KeyError 和多轮奖励),建议在使用 ReMax 时注意检查多轮 reward 场景,并考虑加强 baseline 获取的健壮性。
原始 PR · 作者 Mengyuyang · 合并时间 2026-05-14 12:03
拆分 Ascend 安装与快速启动文档
本 PR 为文档重构,建议用户查阅新版文档以获取最新安装指导。对于开发者,可关注文档结构和版本表的维护方式。
原始 PR · 作者 SteadfastAsArt · 合并时间 2026-05-14 08:39
放宽 FSDP wrap 层名解析,支持部分缺失
此 PR 修复了一个真实阻碍训练的问题,代码简洁,测试覆盖良好,推荐集成。但建议在新 PR 中跟进 reviewer 提出的字符串类型归一化建议,以确保从配置文件传入字符串时的鲁棒性。
原始 PR · 作者 ChangyiYang · 合并时间 2026-05-14 08:29
修复 FSDP 保存检查点时 tied weights 重复导致的加载错误
值得精读,尤其是理解 FSDP 与 Hugging Face transformers 检查点互操作的深层坑点。建议阅读 `drop_tied_target_keys` 实现和 review 讨论中关于 identity 检测与不变式维护的权衡。考虑为核心逻辑添加单元测试。
参与讨论