Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 18:49 同步状态:空闲 下次计划:2026-09-01 19:49

PR 列表

更多筛选
2026-05-22
基础设施 重要性 6.06 洞察度 4.00

替换 Qwen2.5 测试用例为 Qwen3

该 PR 为常规的 CI 模型升级与清理,技术复杂度较低,但展示了测试脚本演变和 CI 配置管理方式。建议阅读以了解 Ascend 测试用例的组织结构,并留意 reviewer 提出的配置优化建议(如移除冗余 critic 参数)。重点关注 `test_check_profiler_output.py` 中移除计数检查的权衡——在简洁性和严格性之间需根据实际输出特点取舍。

缺陷修复 重要性 4.99 洞察度 3.00

修复 FullyAsync 未初始化 _dump_executor 的 bug

本 PR 为一次精准的 bugfix,改动小、风险低,建议快速合并。对于关注 fully_async 功能的开发者,可以留意 _init_dump_executor 和 validation_generations_logger 的后续维护,确保与基类变更保持同步。

缺陷修复 重要性 7.05 洞察度 5.00

修复PPO actor LoRA检查点丢失训练元数据

值得阅读的 PR,展示了如何通过扩展 CheckpointManager 而非修改 trainer 来支持新功能,以及基于分布式后端设计(FSDP vs Megatron)决定是否复用已有机制的权衡决策。review 中关于 Megatron Bridge 的讨论尤其值得关注。

#6393 [docker] chore: update vllm 0.20.2 image

原始 PR · 作者 ETOgaosion · 合并时间 2026-05-22 21:14

重构 重要性 8.34 洞察度 5.00

升级vLLM至0.20.2,适配FP8和server API

该PR值得仔细阅读,特别是`vllm_fp8_utils.py`中通过unittest.mock.patch适配上游API的“猴子补丁”模式,以及Dockerfile构建参数的抽象策略。这些实践可用于其他类似升级场景。

2026-05-21
缺陷修复 重要性 2.69 洞察度 3.00

修复 GRPO shell 脚本中 DEVICE 变量未初始化

此 PR 为小范围 bug 修复,简单直接,值得快速合并。代码审查中提出的风险(stdout 污染、硬件可用性检测)在实际使用中可能性较低(`torch_npu` 在标准安装下不输出 stdout 信息),且社区已有类似用法,可接受。建议未来对类似自动检测逻辑进行统一抽象。

参与讨论