Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 18:49 同步状态:空闲 下次计划:2026-09-01 19:49

PR 列表

更多筛选
2026-05-28

#6494 [cfg] fix: align dataclass defaults with yaml

原始 PR · 作者 anzhsoft · 合并时间 2026-05-28 13:24

缺陷修复 重要性 5.25 洞察度 3.00

对齐 Python dataclass 默认值与 YAML 配置

推荐阅读:变更直白,但 Issue 中对配置不一致的系统性分析值得关注,可作为后续配置治理的参考。建议合并。

缺陷修复 重要性 7.28 洞察度 5.00

保留 teacher top-k 张量 dense 维度,修复 Megatron OPD 蒸馏预处理崩溃

值得精读的 bugfix PR,展示了在 nested tensor 预处理中如何合理保留末尾维度。核心设计模式可复用。重点关注 `preprocess_bshd_engine` 的 docstring 更新和 `dense_shape` 的用法。

功能 重要性 7.40 洞察度 6.00

Megatron 0.16 与 vLLM 0.18 升级并适配 Ascend

建议对此 PR 进行精读,特别是 `apply_mtp_inference_patch` 的实现方式以及版本条件判断的最佳实践。对于需要维护 Megatron 跨版本兼容性的开发者,这是一个很好的参考样例。

2026-05-27
功能 重要性 5.56 洞察度 6.00

实现 Mooncake 外部 KV 缓存硬重置,保障 RL 正确性

建议所有涉及长序列训练或跨副本 KV 复用的团队仔细阅读此 PR 并升级。值得关注的点:极小的改动面(仅传参 + 版本守卫)即解决了昂贵的正确性问题,展示了对外部组件集成时最小侵入的设计思路。

参与讨论