Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-06-13
缺陷修复 重要性 4.03 洞察度 2.00

修复全异步音频转发契约测试目标文件

建议合并。该 PR 修正了测试中的断言位置,使其与实际的转发实现一致,提高了测试的有效性和可靠性。值得关注的是,开发者在描述中已主动搜索了相似 PR 并确认无重复,体现了良好的协作习惯。

重构 重要性 7.99 洞察度 5.00

迁移 FullyAsyncLLMServerClient 至核心模块,供异步 trainer 使用

建议阅读此 PR 以了解异步训练中 rollout 客户端如何统一,并关注未解决的 LSP 问题。设计上迁移到核心模块是合理的演进方向。

2026-06-12
功能 重要性 9.36 洞察度 6.00

引入统一Trainer抽象,支持同步与异步PPO训练模式

### 建议 本 PR 是 PPO 训练器的重大架构重构,值得所有开发者和高级用户精读。重点关注抽象基类的设计模式、TransferQueue 集成方案以及异步模式的生命周期管理。但分离异步模式尚未完成,不建议生产环境使用。建议在后续 PR 中优先修复配置路径错误、完成 `_compute_reward_colocate` 实现并补充更多测试覆盖。

缺陷修复 重要性 7.81 洞察度 5.00

为 NaiveRewardManager 添加 per-sample 超时机制

建议在以下场景启用:使用自定义 `compute_score` 可能存在性能波动(如基于规则的数学验证、符号计算)时。PR 设计谨慎,适合合入。后续可关注线程安全的超时机制(如 `concurrent.futures` 进程池)以替代信号方案。

功能 重要性 7.56 洞察度 6.00

新增 AMD ROCm 平台后端 PlatformROCm

本 PR 设计清晰,通过类继承与最小化覆写策略为 AMD ROCm 添加了一等平台支持。建议关注以下设计点:1)`PlatformROCm` 继承 `PlatformCUDA` 而非完全从零实现,适用于 API 兼容性高的场景;2)通过 guard 在父类中短路避免误检测;3)在 `rollout_env_vars` 中提供用户可覆写的默认值。该模式可供后续新硬件平台(如 Intel GPU)参考。

#6704 [fsdp] fix: handle missing chunked top-k config

原始 PR · 作者 Luosuu · 合并时间 2026-06-12 14:17

缺陷修复 重要性 4.88 洞察度 3.00

修复 chunked top-k 配置缺失导致的 AttributeError

该 PR 是必要的小修复,值得快速合并。精读价值不高,但可作为向后兼容性处理的典范(使用 `getattr` 加默认值处理可选配置字段)。

参与讨论