Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 18:49 同步状态:空闲 下次计划:2026-09-01 19:49

PR 列表

更多筛选
2026-05-25
缺陷修复 重要性 7.58 洞察度 5.00

重命名 MindSpeed 策略并修复后端兼容性

建议精读,重点关注 `MindSpeedEngineConfig` 的变更和 `get_base_mcore_config_from_engine_config` 的设计取舍。合并后可引导用户迁移配置,并尽快补充 FSDP 策略的处理。

缺陷修复 重要性 9.18 洞察度 6.00

修复Megatron MTP训练与rollout指标对齐

该PR修复了多个MTP训练关键bug(loss污染、mask错位、recompute崩溃),建议优先合并。但需关注bias处理问题,确认目标模型输出层是否使用bias;若使用,后续应跟踪补充bias加法逻辑。代码结构清晰,但测试覆盖不足是主要风险。建议团队内部补充CI测试用例。

重构 重要性 8.75 洞察度 3.00

删除 Qwen2.5VL 旧版 mcore 实现,清理 1618 行代码

该 PR 是标准的代码清理操作,对于理解如何安全、彻底地删除一个模型模块有参考价值。模型开发者可关注 `model_initializer.py` 中的注册机制,以及 review 中强调的全量清理原则。一般阅读者浏览执行摘要即可。

功能 重要性 9.00 洞察度 5.00

添加 Trackio 作为 rollout trace 后端

值得精读。该 PR 展示了如何以一致的设计模式扩展 verl 的追踪后端,对希望集成其他实验追踪工具的开发者有参考价值。核心实现(RolloutTraceConfig.init、rollout_trace_attr、_TrackioLoggingAdapter)逻辑清晰,适合作为模板。

2026-05-24

#6453 [veomni] feat: add VeOmni-native critic support

原始 PR · 作者 Luosuu · 合并时间 2026-05-24 14:14

功能 重要性 7.88 洞察度 5.00

新增 VeOmni 原生 critic 训练支持

本 PR 是 VeOmni 功能生态的重要扩展,具有中等重要度。建议: - 核心开发人员精读 `VeOmniEngine` 的共享方法提取和类属性设计,该模式可推广到其他引擎。 - 关注后续是否补充单元测试或集成测试,特别是 `VeOmniEngineWithValueHead` 的各种配置组合。 - 考虑在文档中说明 `VeOmniCriticConfig` 的使用方法和参数要求。

2026-05-23
缺陷修复 重要性 6.66 洞察度 6.00

修复FP8在async RL和多节点rollout中的bug

值得关注的设计决策:将全局副作用改为opt-in环境变量,避免影响不相关场景;FP8配置的安全访问方式(先调用父类再使用self.config)可以作为代码规范。该PR适合rollout和trainer相关开发人员阅读。

参与讨论