Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-06-30
缺陷修复 重要性 4.38 洞察度 2.00

为 Ascend A2G3 设备添加 FLOPS 估算值

该 PR 值得快速合入,它修复了 Ascend A2G3 用户的 MFU 指标计算问题。对于关注硬件兼容性的团队,这是一个学习如何扩展设备 FLOPS 表的良好示例。不涉及复杂设计决策,无需精读。

2026-06-29
功能 重要性 4.68 洞察度 3.00

新增Ascend NPU Qwen3-32B GSPO训练脚本及文档链接

对于需要在Ascend NPU上使用GSPO算法训练Qwen3-32B的用户,此PR提供了可靠的参考实现。建议关注以下几点: - GSPO的配置差异点(对比GRPO):`loss_mode=gspo`、`loss_agg_mode=seq-mean-token-mean`以及不使用KL惩罚。 - FSDP2与vLLM rollout的协同配置,特别是序列并行度(SP_SIZE)和TP的分配。 - 环境变量对性能的影响,可按需启用jemalloc等优化。 整体而言,该PR设计清晰,适合作为在Ascend上运行GSPO的基础模板。

#6889 [ci] chore: add qwen3_5 megatron images

原始 PR · 作者 wucong25 · 合并时间 2026-06-29 19:28

基础设施 重要性 3.69 洞察度 2.00

为 Ascend 镜像添加 Megatron 组件

建议合并,但需确认 bot 指出的续行符问题已在第二个 commit 中完全解决。同时建议后续跟踪镜像构建日志。

修复 OPD 训练中 teacher 温度配置引发的崩溃

值得快速合并,是一个纯增益的低风险修复。可关注后续项目级日志配置清理 PR。建议阅读 `_get_teacher_sampling_params` 的注释以了解 Hydra 插值导致的配置传播问题。

缺陷修复 重要性 5.21 洞察度 2.00

修复 Sphinx 文档侧边栏与主内容同步滚动问题

该 PR 为轻量级前端修复,值得关注的是其利用 Sphinx 内置对象修改行为的方式,可作文档定制参考。实现简单、风险低,建议合入。

缺陷修复 重要性 5.09 洞察度 3.00

修复 partial_rollout 禁用时丢弃中止样本的逻辑

可以合入,修复了废弃样本重试的逻辑。后续若 OmegaConf 配置访问方式统一,可考虑使用 `OmegaConf.select` 替代 `hasattr`。

参与讨论