Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-02 19:36 同步状态:空闲 下次计划:2026-09-02 20:36

PR 列表

更多筛选
2026-07-23
2026-07-22
性能优化 重要性 7.29 洞察度 6.00

FSDP梯度延迟同步,减少微批通信开销

此 PR 值得精读,尤其是设计权衡(通信延迟 vs 显存增加)的实现方式。通过上下文管理器优雅地控制同步边界,测试方法(模拟模块事件记录)也是良好的单元测试范例。建议在引入新硬件后端时验证 FSDP2 的兼容性。

2026-07-21
缺陷修复 重要性 6.34 洞察度 5.00

修复 VeOmni 引擎在 FSDP2 卸载下的崩溃

值得精读,特别是对于使用 VeOmni 引擎且启用 FSDP2 CPU offload 的团队。PR 设计清晰,与 #6604 的 FSDP 引擎修复保持了一致性,同时代码中注释详实,解释了为何跳过 `load_veomni_model_to_gpu` 是安全的。

缺陷修复 重要性 9.18 洞察度 6.00

修复 Qwen3.5 LoRA 与 MTP 权重同步与分桶传输问题

值得精读,尤其是权重名称归一化的重构思路(将名称处理推向接收端)和多桶 LoRA 累积的设计;对于维护后续模型兼容性有参考价值;需关注 Copilot 提出的性能优化建议(reverse_mapping 缓存)是否已在最终版本完全采纳。

2026-07-20
缺陷修复 重要性 9.17 洞察度 7.00

修复 Qwen3.5 线性注意力 Ulysses SP 序列边界问题

值得精读。该 PR 展示了如何在 FSDP 框架下支持自定义模型的 packed 训练,涉及 monkey patch、分布式上下文构建(CP context)、签名检测保持模型无关性等技巧。特别关注 `_build_fla_cp_context` 和 `_prepend_cp_conv_prefix` 的设计,以及如何在不破坏引擎通用性的前提下传递 packed 序列边界。

功能 重要性 9.36 洞察度 7.00

引入动态资源调度提升异步训练 GPU 利用率

建议: - **优先解决 `ray.get()` 阻塞问题**:这是影响稳定性的关键 bug,应在合并前改用 `await`。 - **增加单元测试**:至少对 `DynamicScheduleContext` 计算、`DefaultDynamicSchedulePolicy` 决策逻辑、`DynamicResourceController` 状态转换进行模拟测试。 - **关注 `abort_replicas` 位置**:接受 wuxibin89 建议,将相关操作完全挪至 controller。 - **值得精读**:动态调度策略的设计模式(可插拔、上下文驱动)具有参考价值,可作为未来类似功能的样板。

参与讨论