Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-06-05
缺陷修复 重要性 5.07 洞察度 4.00

修复 filter_overlong_prompts 硬编码图像 patch_size 导致的崩溃

值得一读:这是一个典型的多模态数据处理中配置不一致导致的 bug 修复,展现了如何在数据预处理与 rollout 路径间对齐配置。虽然改动很小,但设计上考虑了回退逻辑和显式 `None` 的情况,适合作为类似问题的修复范例。

功能 重要性 8.23 洞察度 5.00

VeOmni 专家重配内存从 O(E) 优化至 O(E/ep_size)

推荐阅读,特别是 `transformer_impl.py` 中的广播循环设计,以及 `utils.py` 中如何通过生成器模式灵活处理不同 MoE 配置下的参数映射。同时关注 review 中的两个争议点(参数名与 buffer 共享),提醒在类似模式中注意数据隔离。

功能 重要性 9.00 洞察度 5.00

新增 rollout 部分 token profiling 窗口配置

该 PR 值得精读,特别是 `config.py` 中字段添加与验证的方式,以及 `build_vllm_profiler_args` 中的映射逻辑。设计上采用了半开区间,与后端惯用参数一致。代码组织上将 `TorchMemoryProfiler` 独立成模块,体现了良好的模块化思想。建议在后续重构中提取公共验证函数。

2026-06-04

#6606 [tool] fix: update npu profiling test scrip

原始 PR · 作者 yyyy2000 · 合并时间 2026-06-04 19:13

其他 重要性 3.99 洞察度 4.00

NPU 性能分析测试脚本参数灵活化

值得快速浏览但不需深度精读。主要学习点是 '将硬编码参数环境变量化' 的测试脚本重构模式,以及双引号包裹变量防止 globbing 的 Bash 最佳实践。对于其他测试脚本有借鉴意义。

功能 重要性 9.36 洞察度 8.00

新增平台抽象层与插件化引擎覆写系统

值得精读。该 PR 是 verl 多芯片支持的基础设施重构,其 `PlatformBase` + `PlatformRegistry` 设计模式清晰,与 `EngineRegistry` 的 last-writer-wins 覆写配合形成可扩展插件体系。Review 讨论中关于检测策略、覆写策略的权衡也富有参考价值。

缺陷修复 重要性 6.87 洞察度 5.00

修复 Ascend NPU 上 MXFP8 训练的多个问题

建议对 Ascend NPU 上运行 RL 训练的工程师阅读此 PR,尤其是 `reset_fp8_reuse_quantized_weight` 的设计(如何配合 `fp8_reuse_quantized_weight` 功能)、环境变量分离策略以及 `to` 方法的覆盖模式。这些模式可用于未来扩展其他后端。

功能 重要性 9.36 洞察度 8.00

引入SkipManager统一管理skip调试方案

该PR展示了如何在RL训练框架中设计可扩展的skip调试基础设施,装饰器+注册机制的设计模式值得学习。建议技术管理者重点关注其设计决策(如同步/异步统一处理、验证批次绕过、并发安全)。对于稳定性要求高的环境,建议在充分测试后合并,并督促后续完成main_ppo_sync适配。

#6586 [ci] fix: chang sglang8.5.0 a3

原始 PR · 作者 daikang6 · 合并时间 2026-06-04 10:15

基础设施 重要性 3.03 洞察度 2.00

升级 Ascend Docker 中 MindSpeed/Megatron-LM 版本至 core_r0.16.0

建议关注后续 NPU CI 稳定性,确认新版本兼容性。本次为常规依赖升级,无需深入精读。

参与讨论