Prhub

verl-project/verl 2026 第26周周报 (06-22 至 06-28)

本周 verl 项目围绕算法增强、模型支持和基础设施稳定性展开,重点提升了训练复现性与工具链健壮性。

仓库:verl-project/verl 周期:2026-06-22 至 2026-06-28 来源 PR:22 · 重点 PR:22 自动生成 · 生成于 2026-06-29 01:04

本周亮点

  • 连续 Token 机制(#6779)奠定了多轮 Agentic Rollout 的架构基础,通过构建器模式统一处理多模型族 token 连续性。
  • 完全确定性支持(#6572)为 vLLM rollout 和 reward model 提供端到端可重现训练,是调试和科学实验的关键能力。
  • V1 PPO trainer 默认启用(#6823)带来配置键名变更和 breaking change,用户需显式设置 use_v1=False 保留旧行为。
  • NPU 补丁重构实现按模型隔离故障(#6777),避免单模型缺失导致全部补丁失效,提升了 Ascend 平台的鲁棒性。
  • Megatron 优化器状态与 DDP 梯度桶对齐(#6526)新增配置项以降低显存占用,但默认仍保留 fp32 保证精度。
  • 多项 bugfix 修复了 rollout 指标死指标(#6806)、fused kernel 布局崩溃(#6846)以及 fully async trainer 日志偏移(#6796)。
  • Ascend 生态持续完善:新增 Qwen3.5-122B 长序列启动脚本(#6807)、v0.8.0 Docker 镜像(#6820)以及多个 CI 修复。

风险观察

  • 核心路径变更(连续 Token、默认 V1 trainer、NPU 补丁重构等)可能对现有工作流产生影响。
  • 完全确定性支持和 Megatron 优化器对齐缺少自动化测试覆盖,需后续补全。
  • Docker 镜像和 CI 配置中曾出现版本号错误(如 #6820 中 v0.7.1 误用),建议引入自动化版本检查。
  • V1 trainer 默认切换为 breaking change,用户需仔细迁移配置,存在遗漏风险。
  • 共置奖励模型在 separate_async 模式下显式禁止,但仍需关注 GPU 内存竞争问题。

完整周报

verl-project/verl 2026 第26周周报

1. 执行摘要

本周(2026-06-22至2026-06-28)verl项目共合并22个PR,重点集中在算法训练能力增强、Ascend NPU平台支持深化以及基础设施鲁棒性提升。最值得关注的变化包括:连续Token机制的引入为多轮Agentic Rollout提供了统一tokenization方案;完全确定性支持的实现使得训练过程可复现;V1 PPO trainer正式默认启用(breaking change)。此外,NPU补丁按模型隔离重构、多个关键bugfix以及Ascend CI与文档的持续改善,共同推动了项目在功能完整性和工程质量上的稳步前进。

2. 本周重点变化

  • 连续Token机制(#6779):该PR设计了多模型族的ContinuousTokenBuilder架构,通过中央化构建器替代散落在AgentLoop中的手动拼接,确保多轮对话中token ID与元数据的连续性和对齐。当前默认关闭,待多模态支持后转为默认。

  • 完全确定性支持(#6572):为vLLM rollout和reward model新增full_determinism配置,通过设置确定性环境变量、priority调度和hash路由,实现端到端可重现训练。这是对调试和科学可重复性需求的重要回应。

  • V1 Trainer默认启用(#6823):将V1 PPO trainer设为默认,涉及配置键名统一(model_config→model)和参考策略变量引用修正。用户需在配置中显式设置use_v1=False以沿用旧行为。讨论中暴露了temperature参数传递的职责边界问题,建议后续统一清理。

  • NPU补丁按模型隔离重构(#6777):将模块级急切导入改为按模型懒加载,每个模型补丁独立捕获异常,避免单模型缺失导致全部补丁失效。这是Ascend平台可靠性的一次重要提升。

  • Megatron优化器状态对齐(#6526):新增use_precision_aware_optimizer配置项,允许将优化器状态和DDP梯度桶降为bf16以降低显存,默认仍为fp32。经过收敛性实验验证后,作为可选功能发布。

3. 模块与主题趋势

  • Ascend NPU生态:本周是NPU相关PR数量最多的一周(9个),涵盖示例脚本、Docker镜像、CI修复、文档更新和功能新增。这表明Ascend平台正在快速迭代并逐步成为一等公民。
  • 训练器与算法:V1 trainer默认化标志着v0.8.0即将到来。连续Token、确定性支持和共置奖励模型等特性均围绕训练体验和可复现性展开,体现了对研究严肃性的重视。
  • 基础设施与CI:CI工作流和Dockerfile的频繁调整(如共享内存增大、版本修复)反映出项目在多节点、多硬件环境下的持续磨合。nightly CI基线检查的引入加强了回归检测。
  • Bugfix密集:本周7个bugfix覆盖了指标死指标、布局崩溃、日志偏移、配置typefos等,表明项目正处于积极扫除遗留问题的高频率开发阶段。

4. 风险观察

  • 核心路径变更风险:连续Token、默认V1 trainer、NPU补丁重构和完全确定性均属于核心路径变更,可能对现有工作流产生破坏性影响。尤其是V1 trainer的配置键名变更需要用户主动适配。
  • 缺少测试覆盖:完全确定性支持和Megatron优化器对齐等PR明确标注缺少自动化测试覆盖,后续需补充单元测试以防止回归。
  • 版本错配风险:Docker镜像和文档中曾出现版本号错误(如将v0.8.0误标为v0.7.1),说明发布流程中仍存在人为疏忽,建议引入自动化版本检查机制。
  • 共置奖励模型GPU内存竞争:separate_async模式下显式禁止共置奖励模型,但仍可能在其他模式下引发内存分配问题,需持续监控。
  • 配置变更频繁:多个PR涉及配置键名、默认值或类型注解的调整,用户升级时需仔细核对配置迁移指南。

5. 重点PR速览

PR编号 标题要点 重要性 关键贡献
#6779 Continuous Token for Agentic Rollout 9.4 多轮token连续性构建器架构,默认关闭
#6572 Full determinism for vLLM rollout/RM 8.7 端到端可重现训练,环境变量与路由
#6526 Align optimizer states with model precision 8.5 Megatron显存优化选项(可选)
#6777 Per-model NPU patches with fault isolation 8.4 按模型懒加载,错误隔离
#6818 Colocated reward model for V1 trainer 8.2 共置奖励模型评分实现
#6823 Enable V1 trainer by default 6.8 Breaking change,配置键名统一
#6796 Fix aggregated metrics logging in fully_async 6.6 修复指标日志偏移
#6846 Fix fused log_probs/entropy in NO_PADDING 6.5 修复布局不匹配崩溃
#6842 Write HF config before bridge save 6.0 修复Megatron断点分片推断
#6807 Qwen3.5-122B long seq launch script for Ascend 5.2 4节点64卡GRPO启动脚本

(注:按重要性降序排列,仅列出重要性≥5的PR)

6. 后续建议

  1. 关注V1 trainer迁移:从本周开始,新用户默认使用V1 trainer,现有V0用户应评估迁移成本,重点关注配置键名change和refer策略调整。
  2. 验证确定性训练:对于需要严格复现的实验场景,建议尽早启用full_determinism并反馈潜在问题。
  3. 评估连续Token机制:虽然当前默认关闭,但该机制将对多轮Agent Loop产生根本性影响,建议相关团队提前熟悉其设计和配置方式。
  4. 补充测试覆盖:针对完全确定性、Megatron优化器对齐等关键特性,应尽快补充自动化测试,确保长期可维护性。
  5. 优化Ascend CI:鉴于NPU平台活跃度持续上升,建议进一步优化CI基础架构(如调整共享内存、版本检查),并完善基线测试用例。
  6. 版本管理与沟通:在即将发布的v0.8.0中,应确保变更日志清晰,特别是breaking changes的说明,并通过讨论或文档引导用户平滑升级。

以上为本周周报,建议团队周会上对重点PR和技术决策进行深入讨论。

参与讨论