Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-07-29
功能 重要性 6.55 洞察度 6.00

V1 separate_async 支持解耦 PPO

值得精读。该 PR 展示了如何在现有异步训练框架中支持高级算法(Decoupled PPO),特别是通过 CPU 权重快照实现多步旧策略一致性的设计模式。评审过程展现了好的代码质量实践——将状态追踪移入基类、统一索引约定。建议关注后续对 DetachActorWorker 的测试覆盖和稳定性。

文档 重要性 5.14 洞察度 2.00

刷新 FSDP 和 SkyPilot 文档,删除过时多轮示例

推荐阅读以了解当前 FSDP 模型集成路径和 SkyPilot 使用入口。特别是模型集成权限的明确划分值得注意。

功能 重要性 9.18 洞察度 7.00

VeOmni EP感知分片delta导出,大幅加速MoE权重同步

值得仔细阅读。特别关注:(1) 如何通过handler自身探测slot表(`enumerate_hf_slots`)来避免手动维护slot表;(2) NaN sentinel的设计使得每个rank可以独立完成delta转换,无需rank 0全量重建;(3) `BlockPlacement`如何统一表达EP手动分割和FSDP DTensor分割。

#7179 [vllm] refactor: clean up weight sync

原始 PR · 作者 wuxibin89 · 合并时间 2026-07-29 10:06

重构 重要性 7.19 洞察度 5.00

重构 vLLM 权重同步逻辑

建议合并,但应补充测试覆盖 FP8 权重同步路径,以确保重构后行为一致。

2026-07-28
基础设施 重要性 3.50 洞察度 2.00

修复 Ascend 夜间 CI 和 Docker 构建缓存

该 PR 是常规的 CI 维护,技术含量低,但值得关注其修复模式(步骤顺序调整和缓存作用域),未来类似 CI 问题可借鉴。建议快速合并。

参与讨论