Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 18:49 同步状态:空闲 下次计划:2026-09-01 19:49

PR 列表

更多筛选
2026-03-31
缺陷修复 重要性 5.00 洞察度 4.00

修复 vanilla mbridge 路径中 DDP 配置的 use_distributed_optimizer 传递错误,确保梯度同步方式正确。

该 PR 值得快速浏览以了解 Megatron 模块中配置传递的模式。对于维护 megatron 相关代码的工程师,建议关注 peft_pre_wrap_hook 函数的逻辑,因为它展示了如何处理 DDP 配置的构建和覆盖。变更虽小,但涉及核心路径,有助于避免类似配置错误。

缺陷修复 重要性 5.00 洞察度 4.00

修复NPU环境下split_resource_pool的设备名设置,避免Ray自动扩展失败。

建议关注此PR,以了解如何在Ray actor中正确处理设备检测。对于类似代码,考虑采纳gemini的建议,将设备检测逻辑中心化,并添加相应测试以确保覆盖,以提高代码质量和维护性。

缺陷修复 重要性 3.00 洞察度 2.00

修复 rollout 处理器缺失 image_processor 时的属性错误,避免程序崩溃。

这是一个简单的防御性编程修复,值得快速浏览以学习如何在类似场景中应用 hasattr 检查避免属性错误,但对于复杂设计决策的学习价值有限。建议工程师在访问可能缺失的属性时参考此做法。

缺陷修复 重要性 6.00 洞察度 6.00

修复SGLang rollout中LoRA适配器路径的权重同步顺序和内存释放问题。

建议精读engine_workers.py中的update_weights方法,关注base_sync_done逻辑调整和两阶段同步设计,这体现了SGLang与vLLM后端在LoRA处理上的重要差异。同时,review讨论中的跨后端兼容性权衡值得关注。

#5057 [megatron] feat: support dynamic CP

原始 PR · 作者 ISEEKYAN · 合并时间 2026-03-31 11:52

功能 重要性 6.00 洞察度 6.00

为Megatron引擎引入动态上下文并行,自适应选择CP大小以优化内存和性能。

建议技术管理者和工程师精读此PR,重点关注动态CP选择逻辑(`dynamic_cp_split_batch`函数)、前后处理函数的适配(`preprocess_thd_engine`和`postprocess_thd_engine`),以及Megatron版本兼容性处理。这些设计决策展示了自适应并行策略的实现模式,值得学习。

2026-03-30
重构 重要性 3.00 洞察度 4.00

移除完全异步策略中硬编码的工具代理循环,简化agent名称分配逻辑。

建议开发者在阅读此PR时,关注review中指出的潜在风险,并检查下游代码(如agent_loop或rollout模块)是否适配agent_name的隐式处理。此PR展示了代码清理时的设计权衡,值得注意但变更简单,无需深度精读。

基础设施 重要性 5.00 洞察度 3.00

添加 Ascend A2/A3 的 sglang Docker 镜像构建流水线。

建议工程师在设置类似 Ascend 硬件流水线时参考此 PR,重点关注 CI 工作流的配置正确性和 Secrets 管理;对于依赖变更,建议后续添加测试验证镜像构建成功。

参与讨论