修复DAPO overlong penalty配置门控条件
值得参考其防御性编程思路:断言条件应精准匹配实际激活路径,避免与配置语义矛盾。同时建议合并前确保实验版本的 `run_single` 也有 None 检查,但本 PR 未涉及。
verl: Volcano Engine Reinforcement Learning for LLMs
修复DAPO overlong penalty配置门控条件
值得参考其防御性编程思路:断言条件应精准匹配实际激活路径,避免与配置语义矛盾。同时建议合并前确保实验版本的 `run_single` 也有 None 检查,但本 PR 未涉及。
修复全异步音频转发契约测试目标文件
建议合并。该 PR 修正了测试中的断言位置,使其与实际的转发实现一致,提高了测试的有效性和可靠性。值得关注的是,开发者在描述中已主动搜索了相似 PR 并确认无重复,体现了良好的协作习惯。
迁移 FullyAsyncLLMServerClient 至核心模块,供异步 trainer 使用
建议阅读此 PR 以了解异步训练中 rollout 客户端如何统一,并关注未解决的 LSP 问题。设计上迁移到核心模块是合理的演进方向。
引入统一Trainer抽象,支持同步与异步PPO训练模式
### 建议 本 PR 是 PPO 训练器的重大架构重构,值得所有开发者和高级用户精读。重点关注抽象基类的设计模式、TransferQueue 集成方案以及异步模式的生命周期管理。但分离异步模式尚未完成,不建议生产环境使用。建议在后续 PR 中优先修复配置路径错误、完成 `_compute_reward_colocate` 实现并补充更多测试覆盖。
为 NaiveRewardManager 添加 per-sample 超时机制
建议在以下场景启用:使用自定义 `compute_score` 可能存在性能波动(如基于规则的数学验证、符号计算)时。PR 设计谨慎,适合合入。后续可关注线程安全的超时机制(如 `concurrent.futures` 进程池)以替代信号方案。
原始 PR · 作者 xiaohong42 · 合并时间 2026-06-12 14:37
新增 AMD ROCm 平台后端 PlatformROCm
本 PR 设计清晰,通过类继承与最小化覆写策略为 AMD ROCm 添加了一等平台支持。建议关注以下设计点:1)`PlatformROCm` 继承 `PlatformCUDA` 而非完全从零实现,适用于 API 兼容性高的场景;2)通过 guard 在父类中短路避免误检测;3)在 `rollout_env_vars` 中提供用户可覆写的默认值。该模式可供后续新硬件平台(如 Intel GPU)参考。
原始 PR · 作者 HaozheZhang6 · 合并时间 2026-06-12 14:21
修复 LoRA 权重在 IPC 缓冲中的视图导致崩溃
值得快速合入。该 PR 修复了一个明确的 tensor 生命周期 bug,改动极小且安全。对于理解 verl 中 IPC 缓冲区与 LoRA 权重的交互有参考价值。
修复 chunked top-k 配置缺失导致的 AttributeError
该 PR 是必要的小修复,值得快速合并。精读价值不高,但可作为向后兼容性处理的典范(使用 `getattr` 加默认值处理可选配置字段)。
参与讨论