Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 20:03 同步状态:空闲 下次计划:2026-09-01 21:03

PR 列表

更多筛选
2026-04-27
缺陷修复 重要性 6.21 洞察度 5.00

修复嵌套张量重建对非最后 ragged 维的支持

该 PR 值得精读,展示了如何以最小改动修复一个因硬编码假设导致的通用性问题。读者可重点关注 `nested_tensor_from_tensor_list` 中 `cat_dim` 的推导以及 `getattr` 回退模式。同时建议跟进 review 中未解决的问题,尤其考虑添加 `ragged_dim` 参数到 `nested_tensor_from_jagged` 调用,并评估默认回退值是否应改为 1。

功能 重要性 8.14 洞察度 5.00

在 fully async 训练中启用独立 GenRM/DisRM 奖励模型

本 PR 解除了 fully async 模式中长期存在的 GPU 奖励模型限制,对需要大模型评判的场景至关重要。值得深入阅读的设计决策包括:如何将 RM 管理从训练器委托给 Rollouter、为什么强制 standalone 模式、以及遗留的 `use_trainer_do_validate` 冲突问题。建议合入前先确认 `rm_resource_pool` 硬编码问题是否已有短期修复计划,若急需使用可先合并但需注意资源冲突风险。

2026-04-24
缺陷修复 重要性 5.03 洞察度 6.00

修复工具调用循环中MoE路由专家张量未截断导致形状不匹配的bug

该 PR 值得精读,它演示了在处理 MoE 路由专家信息时一个常见的陷阱:`routed_experts` 与 `response_ids` 的语义差异(前者包含 prompt 部分,后者不包含),以及如何通过正确的截断来避免形状不匹配。同时这是一个很好的 review 案例,展示了 AI 辅助 review 如何抓住核心逻辑错误并给出精准建议。对于维护 agent_loop 的开发者,建议关注其他可能使用 `routed_experts` 的地方是否有类似问题。

#5898 [model] feat: support qwen35 mtp sft/rl

原始 PR · 作者 zpltys · 合并时间 2026-04-24 10:43

功能 重要性 7.35 洞察度 6.00

支持Qwen3.5 MTP模型在Megatron引擎的SFT/RL训练

### 建议 - **值得精读**:如果团队计划支持更多具备MTP能力的模型,本PR中 `_get_mtp_num_layers` 和 `_set_mtp_num_layers` 的设计模式值得参考。 - **需跟进**: 1. 将辅助函数公开化,以便跨模块复用(来自review高优先级建议)。 2. 修复 `config_converter.py` 中MTP检测逻辑,复用公共函数并正确处理override。 - **测试**:建议为 `megatron_utils.py` 中的MTP函数编写单元测试,覆盖三种配置格式。

功能 重要性 7.18 洞察度 6.00

改进ToolAgentLoop工具调用错误信息,提供更具可操作性的反馈

该PR值得精读,尤其是`_call_tool`方法的拆分逻辑——展示了如何将一个catching all的异常处理重构为细粒度、信息丰富的错误反馈,这对LLM agent的self-correction能力至关重要。建议合并后关注review中提出的`finally`块风险,并考虑后续改进。

缺陷修复 重要性 6.92 洞察度 6.00

修复等长序列嵌套张量重建时的布局损坏

建议 **阅读** 本 PR,特别是 `nested_tensor_from_tensor_list` 的实现和 `dataset_utils.py` 的简化模式。设计上通过显式控制 `_ragged_idx` 避免了对 torch 默认可疑行为的依赖。

2026-04-23
缺陷修复 重要性 6.21 洞察度 4.00

限制SGLang控制请求仅发送给主节点服务器

该PR为针对多节点SGLang控制路径的定向修复,逻辑简单且仅涉及控制流。建议合并,但后续可考虑增加 `self.servers` 非空判读的防御性检查或添加测试用例。

参与讨论