为Ascend CI新增Qwen3-0.6B和GRPO profiling用例
该PR是常规CI维护改进,值得关注其新增测试的模式,可用于参考如何添加新的CI测试。
verl: Volcano Engine Reinforcement Learning for LLMs
为Ascend CI新增Qwen3-0.6B和GRPO profiling用例
该PR是常规CI维护改进,值得关注其新增测试的模式,可用于参考如何添加新的CI测试。
原始 PR · 作者 Mengyuyang · 合并时间 2026-06-30 10:21
为 Ascend A2G3 设备添加 FLOPS 估算值
该 PR 值得快速合入,它修复了 Ascend A2G3 用户的 MFU 指标计算问题。对于关注硬件兼容性的团队,这是一个学习如何扩展设备 FLOPS 表的良好示例。不涉及复杂设计决策,无需精读。
原始 PR · 作者 chengminhua · 合并时间 2026-06-29 20:31
新增Ascend NPU Qwen3-32B GSPO训练脚本及文档链接
对于需要在Ascend NPU上使用GSPO算法训练Qwen3-32B的用户,此PR提供了可靠的参考实现。建议关注以下几点: - GSPO的配置差异点(对比GRPO):`loss_mode=gspo`、`loss_agg_mode=seq-mean-token-mean`以及不使用KL惩罚。 - FSDP2与vLLM rollout的协同配置,特别是序列并行度(SP_SIZE)和TP的分配。 - 环境变量对性能的影响,可按需启用jemalloc等优化。 整体而言,该PR设计清晰,适合作为在Ascend上运行GSPO的基础模板。
为 Ascend 镜像添加 Megatron 组件
建议合并,但需确认 bot 指出的续行符问题已在第二个 commit 中完全解决。同时建议后续跟踪镜像构建日志。
原始 PR · 作者 kenkenpa2126 · 合并时间 2026-06-29 17:13
修复 OPD 训练中 teacher 温度配置引发的崩溃
值得快速合并,是一个纯增益的低风险修复。可关注后续项目级日志配置清理 PR。建议阅读 `_get_teacher_sampling_params` 的注释以了解 Hydra 插值导致的配置传播问题。
修复 Sphinx 文档侧边栏与主内容同步滚动问题
该 PR 为轻量级前端修复,值得关注的是其利用 Sphinx 内置对象修改行为的方式,可作文档定制参考。实现简单、风险低,建议合入。
修复 GLM-4V processor 类名匹配 bug
建议合并,并考虑补充 GLM-4V 的单元测试或 E2E 测试,避免类似回归。
修复 partial_rollout 禁用时丢弃中止样本的逻辑
可以合入,修复了废弃样本重试的逻辑。后续若 OmegaConf 配置访问方式统一,可考虑使用 `OmegaConf.select` 替代 `hasattr`。
参与讨论