修复多轮 rollout trace 缺失逐轮解码文本
值得精读。它展示了如何用最小 API 面修复一个真实用户问题:字段回退解析、输出拷贝保护、按配置注入依赖这三个手法都有可复用性。与未合并的 #5588 对照阅读,可以理解「窄修复 vs 通用 API」的取舍逻辑。若你的团队依赖 agentic RL 的可视化分析,建议尽快合入升级。
verl: Volcano Engine Reinforcement Learning for LLMs
修复多轮 rollout trace 缺失逐轮解码文本
值得精读。它展示了如何用最小 API 面修复一个真实用户问题:字段回退解析、输出拷贝保护、按配置注入依赖这三个手法都有可复用性。与未合并的 #5588 对照阅读,可以理解「窄修复 vs 通用 API」的取舍逻辑。若你的团队依赖 agentic RL 的可视化分析,建议尽快合入升级。
为 HCCL 引擎添加权重分块传输支持
该 PR 值得精读,特别是 `split_weight_chunks` 的使用和异步化改造,展示了如何安全地处理大权重传输。关注点:1) `torch.npu.synchronize()` 的放置位置是否正确;2) 线程池资源是否会成为瓶颈;3) 测试中 128MB bucket 的耗时影响。建议在 NPU 环境中进行充分的端到端验证。
原始 PR · 作者 ChangyiYang · 合并时间 2026-07-31 10:39
Megatron 后端接入分片 delta 权重同步
值得精读。核心看点:(1) comm-stubbed probe 设计——把进程组的 size/rank 语义与通信语义分离,用 NaN 哨兵穿过真实 `megatron_to_hf` 代码得到 HF 坐标,替代手写索引数学;(2) 幂等性验证扫描 `_verify_dense` 对多阶段 loader(如 Mamba 的 `A = -exp(A_log)`)按最终状态而非逐次 `copy_` 比对的判断;(3) 测试分层——TP>1 差分 oracle + 真 sglang 闭环 + CPU 单测构成对 probe 假设的完整回归防线。建议关注 PP/LoRA 的显式报错边界,以及将差分测试纳入 CI 的后续工作。
简化 Ascend Docker 镜像标签名称并更新文档
可快速合并,无特殊关注点。
为 Megatron 后端添加 Muon 优化器支持
此 PR 值得精读,尤其是 `adamw_rms_match_scale_factor` 的推导和实验对比方法。代码设计上对兼容性的处理(字段白名单转发、fail-closed)和 DDP 封装的重构(`wrap_model_chunks_with_layerwise_aware_ddp`)均具有参考价值。建议使用者优先配置 `muon_match_adamw_update_rms` 而非手动设置常量。
原始 PR · 作者 0oshowero0 · 合并时间 2026-07-30 12:02
阻止每次 tqbridge 调用创建新线程和事件循环
建议所有使用 TransferQueue 的开发者精读此 PR,特别是 `transferqueue_utils.py` 中单例事件循环的设计和 `atexit` 注册清理的模式。配置抽取也展示了如何通过 Hydra defaults 实现模块化配置,值得参考。
提升 vLLM 最低支持版本至 0.18.0,移除旧版兼容代码
建议精读 `verl/utils/vllm/vllm_fp8_utils.py` 的改动,了解 FP8 权重处理的版本依赖是如何被剥离的,同时关注 NPU 补丁路径的简化是否覆盖所有场景。
原始 PR · 作者 kaining-never-stop · 合并时间 2026-07-30 06:30
验证模型合并器输出的 Hugging Face 模型完整性
值得精读。本 PR 展示了一个好的防御性编程实践:在关键输出点添加显示后置条件检查,且设计上避免加载权重以保持轻量。对于处理模型保存和上传的开发者有参考价值。
参与讨论