Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-05-08
缺陷修复 重要性 6.49 洞察度 5.00

修复 RewardModelConfig 字段命名、world_size 计算和 YAML 配置缺失项

值得精读,尤其是理解 reward model 如何复用 RolloutConfig 以及 world_size 计算公式。设计决策:将 reward 推理配置视为 rollout 配置的复用,并统一字段名 `rollout`。对于正在使用 reward model 的开发者和用户,建议检查现有 YAML 配置是否使用了 `inference` 字段,并及时迁移。关注后续是否会有更多同步配置的工作(例如 NPU 专用配置)。

doc 重要性 2.88 洞察度 2.00

router_replay 文档配置键路径修正

该 PR 属于常规文档维护,改动量小且正确性明确,无需深度阅读。但可以注意:文档与代码结构同步更新是良好的实践。

功能 重要性 9.00 洞察度 6.00

新增 @function_tool 装饰器实现基于函数的工具注册。

值得精读,尤其关注新工具注册的设计模式(正交路径、自动 schema 推断、命名空间隔离)。对扩展 agent 框架的开发者有参考价值。建议结合测试文件理解使用方式。P.S. 作者计划后续将工具加载移至 AgentLoopWorker,可追踪新 PR。

#6222 [docker] feat: bump aarch64 vllm 0.17->0.18

原始 PR · 作者 kaixih · 合并时间 2026-05-08 11:42

基础设施 重要性 4.32 洞察度 4.00

升级 aarch64 vLLM 至 0.18.0,简化 Dockerfile。

该 PR 为常规基础设施升级和测试修复,影响范围有限。值得关注的是测试中 Ray 初始化模式的改进,可作为团队测试编写的参考。建议尽快合并以解除 aarch64 的 vLLM 版本锁定。

2026-05-07
功能 重要性 4.72 洞察度 5.00

新增 Qwen3.5-122B GRPO 演示脚本及 VeOmni 依赖升级

该 PR 主要是 demo 脚本的添加,对于使用 VeOmniEngine 的用户有参考价值,但核心逻辑简单。建议关注评论中提到的 rollout DP 配置问题,在正式场景中动态计算 `infer_dp`。CI 依赖升级部分属于常规维护。

基础设施 重要性 3.08 洞察度 2.00

升级 TRTLLM 至 1.3.0rc14 并锁定 mbridge 版本

建议关注 review 中关于移除 `-U` 的建议,并确认在后续 PR 中修复。该 PR 本身改动较小,无需深入精读,但了解依赖管理操作对基础设施维护有参考价值。

功能 重要性 9.02 洞察度 6.00

TRTLLM 异步 RL 完整流程实现

建议精读 `trtllm_async_server.py` 中 abort/resume 实现及 `_resolve_chat_stop_tokens` 函数,理解聊天模型生成结束控制的细节;关注 `trtllm_rollout.py` 中 standalone 设备网格初始化策略;跟踪后续性能优化 PR 以形成完整评估。

#6253 [ci] fix: remove the rebundant config

原始 PR · 作者 yyyy2000 · 合并时间 2026-05-07 14:05

缺陷修复 重要性 3.21 洞察度 2.00

移除 NPU 测试脚本中冗余的 context_parallel_size 配置

建议快速合并。这是低风险的清理变更,已经过维护者批准。对于 review 中提出的 actor 侧冗余和缺失配置问题,可以另开 PR 跟进,但当前 PR 的 scope 限定在 ref 模型冗余配置清理是合理的。

参与讨论