Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 18:49 同步状态:空闲 下次计划:2026-09-01 19:49

PR 列表

更多筛选
2026-04-17
功能 重要性 7.40 洞察度 6.00

在同步PPO训练器中新增基于资源池的在线策略蒸馏支持,打通教师模型与TQ数据流。

该PR值得精读,尤其关注其如何将教师模型集成到现有同步训练框架中。设计决策上,优先支持独立资源池模式而非共置模式,这反映了系统架构向解耦和可扩展性发展的方向。建议重点阅读`transferqueue_utils.py`中KVBatchMeta的适配逻辑,以及`main_ppo_sync.py`中资源池初始化和教师管理器唤醒的时序控制。

缺陷修复 重要性 5.08 洞察度 3.00

修复VeOmni FSDP引擎加载模型时使用本地路径而非远程路径的问题。

该PR值得快速浏览,重点关注路径解析逻辑的调整,以理解VeOmni引擎在缓存环境下的模型加载机制。对于涉及远程模型存储的开发者,此设计决策展示了如何优雅处理本地与远程路径的切换。

缺陷修复 重要性 5.66 洞察度 6.00

修复完全异步策略中部分rollout恢复时MoE路由专家重复拼接导致的训练不稳定问题。

该PR值得精读,它揭示了在异步训练中处理路由专家数据时的关键设计决策:直接替换而非拼接,以确保路由与权重版本一致。关注作者与reviewer关于路由切片方案的讨论,以及实验结果的权衡。

2026-04-16
缺陷修复 重要性 8.43 洞察度 6.00

修复多轨迹训练中批次样本数不满足数据并行和PPO小批次可除性导致的错误。

该PR值得精读,特别是`padding_utils.py`中的设计决策:如何构造最小填充样本、处理多维位置ID和专家路由、以及通过`is_padding`标签隔离指标计算。这些设计对于理解分布式训练中的数据对齐和性能权衡有重要参考价值。同时,应关注review中提到的性能瓶颈和边缘情况,在实际部署中监控I/O开销和指标准确性。

基础设施 重要性 2.43 洞察度 1.00

删除两个已废弃的依赖文件,清理项目根目录。

该 PR 变更简单,属于基础设施清理,无需精读。值得关注的点是确认项目是否已完全迁移到其他依赖管理方案,以及是否有隐藏的引用需要同步清理。

基础设施 重要性 4.42 洞察度 3.00

为 Qwen3.5 模型新增 x86_64 架构的 Ascend NPU Docker 镜像支持。

该 PR 变更直接,主要涉及基础设施配置,适合快速浏览以了解新增的 x86_64 架构支持。值得关注的是 reviewer 指出的代码重复和安全问题,这为后续优化提供了明确方向。

功能 重要性 4.60 洞察度 3.00

为 DeepSeek-V3 MoE 模型添加 veomni 引擎参数映射支持。

该 PR 变更简单,适合快速了解 veomni 引擎如何扩展新模型支持。但需注意 review 中提到的映射 bug,建议后续关注相关修复 PR。

参与讨论