Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 18:49 同步状态:空闲 下次计划:2026-09-01 19:49

PR 列表

更多筛选
2026-04-03
功能 重要性 7.00 洞察度 6.00

集成msprobe精度调试工具到VERL统一性能分析系统,支持Ascend训练侧数据收集。

建议技术管理者和工程师精读此PR,重点关注其如何将外部工具集成到统一分析器框架的设计决策,特别是阶段映射、模型解析和开销管理。值得关注`PrecisionDebuggerProfiler`类的实现和配置统一化方式,可作为类似集成的参考模板。

功能 重要性 5.00 洞察度 5.00

新增 Qwen3.5-122B Megatron 启动脚本,支持 32 GPU 大规模 GRPO 训练。

该 PR 对于需要运行 Qwen3.5-122B 或类似大规模模型的工程师值得参考,特别是关注 Megatron 并行配置(如 TP、PP、CP 设置)和模型特定限制(如 GDN 注意力格式)。建议精读脚本中的配置注释,以了解架构权衡和未来优化方向。

#5861 [doc] feat: add NVFP4 QAT documentation

原始 PR · 作者 zhangyimi · 合并时间 2026-04-03 14:10

文档 重要性 3.00 洞察度 2.00

新增NVFP4量化感知训练文档,涵盖FSDP和Megatron后端的配置说明。

该PR值得快速浏览以了解NVFP4 QAT的配置概览,但文档中的两个未解决问题需要后续跟进。建议关注quantization_config_path参数的实际使用情况和模型名称的准确性,以确保文档与代码实现一致。

基础设施 重要性 7.00 洞察度 6.00

修复所有CI流水线,升级transformers至5.3.0和vLLM至0.18.0以解决兼容性问题。

建议工程团队精读此PR,重点关注模型兼容性修复(如rope_theta处理和visual输出解包)和权重同步逻辑重构,这些设计决策展示了处理重大依赖升级时的系统化方法,对类似升级有借鉴意义。

#5871 [doc] chore: add npu faq doc

原始 PR · 作者 hustmf · 合并时间 2026-04-03 10:13

文档 重要性 3.00 洞察度 2.00

添加NPU常见问题解答文档,覆盖环境配置、调试和错误处理。

建议快速浏览以了解NPU常见问题,重点关注review中指出的配置键部分,实际使用时参考'reviewer建议'或配置文件'verl/trainer/config/npu_profile/npu_profile.yaml'。文档本身无需深入代码精读。

其他 重要性 3.00 洞察度 4.00

更新完全异步DAPO训练脚本,调整超参数以对齐同步脚本的奖励进展。

建议相关实验人员仔细阅读该脚本的变更,特别是超参数调整的逻辑。对于研究异步训练调优的工程师,可以关注staleness_threshold和PPO token长度计算的调整策略。普通开发者无需深入阅读。

2026-04-02
重构 重要性 6.00 洞察度 5.00

统一PPO训练器配置,通过model_engine参数替代独立Megatron配置文件

该PR值得精读,因为它是配置系统的重大重构,涉及设计决策如model_engine参数的使用和配置分层。建议关注review中指出的风险点,检查配置迁移指南或文档更新,并验证Megatron工作流的兼容性。

参与讨论