Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-02 19:36 同步状态:空闲 下次计划:2026-09-02 20:36

PR 列表

更多筛选
2026-08-04
缺陷修复 重要性 7.21 洞察度 5.00

ROCm 下 DSA 增加纯 torch 哈达玛变换回退

值得精读 `verl/models/mcore/patch.py` 中 `apply_fast_hadamard_transform_shim` 的实现:它展示了一种“模块名级兼容垫片 + 已捕获符号回填”的模式,对处理第三方包硬编码 import 的硬件移植问题很有参考价值。建议在合入后补充针对回填逻辑的单元测试,并在 ROCm CI 上增加 DeepSeek-V4 DSA 的冒烟用例。

基础设施 重要性 4.27 洞察度 3.00

vLLM/vLLM-Ascend 升到 0.23.0,同步 NPU 文档、镜像与 CI 配置

值得快速扫读而非精读:没有算法或核心逻辑变化,核心价值在于版本配套表和 CI tag 对应关系。建议维护 NPU 环境的同学核对:`install_guidance.rst` 与 `install_guidance_A5.rst` 版本表一致性、夜间 CI 镜像 tag 是否已推送、是否需要在后续 PR 统一 NPU 侧与 GPU 侧的 vLLM 大版本。

文档 重要性 2.81 洞察度 1.00

移除过时的 Ascend fully_async 与 MindSpeed-MM 支持条目

值得快速查看,作为文档清理范例。无需深入阅读,但可参考其删除条目和重新编号的处理方式。

缺陷修复 重要性 7.17 洞察度 5.00

修复 SGLang 在 LoRA merge 模式下仍启用 adapter 的 bug

值得精读。这是一个典型的 bugfix 与设计收敛案例:通过引入单一谓词消除两个后端的行为漂移,并强调两个配置块的不同步问题,对理解 verl 中 LoRA 在 rollout 侧的处理很有帮助。

功能 重要性 6.90 洞察度 5.00

新增 token-sum 损失聚合模式,支持 DP 缩放

该 PR 代码量小、逻辑直白,但其中“乘 dp_size 抵消 DDP/FSDP 平均”的推导值得精读,是一个典型的并行训练损失语义设计。建议阅读 agg_loss 全函数和三个测试用例,理解 token-sum 与 token-mean 在梯度尺度上的差异。对于计划在多卡或 Megatron 后端使用该模式的团队,建议等待后续专门适配或自行验证。

缺陷修复 重要性 7.10 洞察度 5.00

修复 GPT-OSS 非 EP 权重导出格式错误

值得精读,重点看 get_moe_param_handler 的"注册表 + 显式拒绝"设计:对未支持路径宁可 fail loud 也不静默产生不兼容数据;以及透传 handler 与默认 handler 统一契约(name, tensor, expert_id_base)带来的可扩展性。建议后续补充 EP 与 delta_sharded 拒绝路径的测试,并将 megatron/delta_export.py 的无关格式改动拆分到独立 PR。

2026-08-03
重构 重要性 6.11 洞察度 4.00

统一 PPO 入口 tokenizer/processor 构建到 HFModelConfig

值得快速精读,改动虽小(2 文件、+11/-25)但包含一个需要记录的行为决策:tokenizer/processor 的配置权威来源被统一收敛到 HFModelConfig。对维护多模态训练配置或自定义 model config 的工程师有直接参考价值;也值得关注后续是否会由此延伸出 data.trust_remote_code 与 model.trust_remote_code 的废弃/迁移计划。

缺陷修复 重要性 6.51 洞察度 5.00

修复 FSDP 保存 LoRA 模型时错误打包 PeftModel 源码的 bug

值得精读。虽然改动很小,但 PR body 对 transformers custom_object_save 机制和 FSDP1/FSDP2 差异失败模式的分析很有价值;测试设计(stub 分布式原语 + 负向控制验证)也值得借鉴。建议关注 `get_base_model()` 的 peft-only 判断,以及 `save_checkpoint` 中 `auto_map` 分支的容错方式。

参与讨论