2026-08-14
路由索引改 int16,支持超 255 专家并重构回放
值得精读。亮点包括:NCCL 无 int16 时的 uint8 位视图通信模式、用 duplicate-top-k 检测替代显式 replay_mask 的设计取舍、controller 与 engine 的职责划分(controller 不感知形状)。建议阅读时对照 `tests/utils/test_megatron_router_replay_dcp.py` 理解通信层约束,并对照 `verl/workers/utils/padding.py` 的删除逻辑确认数据契约变更范围。
移除 Mindspeed-LLM 后端引擎(约 1941 行)
值得快速浏览(10 分钟内可读完):这是理解 verl 引擎注册架构的很好样例。重点关注 transformer_impl.py 中保留类与删除类的注册差异(backend='megatron' vs backend='mindspeed_megatron'),以及 constants_ppo.py 中运行时环境变量的收敛方式。若团队维护 NPU 训练配置,务必确认没有遗留 mindspeed 策略引用,并规划到 megatron 后端的迁移。整体改动机械、无评审争议,不需要精读源码细节。
AgentLoop 全面启用多模态 Continuous Token 分词
值得精读:`create_continuous_token_builder` 的 processor 门控逻辑、`_MODEL_TYPE_TO_FAMILY` 精确匹配设计、VL builder 基于 MRO 组合文本边界处理的方式都很典型。计划升级到该版本的团队应先核对自定义 AgentLoop 是否使用了被移除的 `apply_chat_template` / `continuous_token.enable`;使用 Qwen3.5 VL 的团队需等待 `QWEN35 → QWEN3_VL` 映射的后续修复。
NCCL 引擎新增多发送者中继模式,权重同步提速约 3 倍
值得精读。核心看点:用 Ray 节点 id 作为 NVLink 可达性代理的拓扑决策、中继本地推导分块边界以避免集合通信死锁的设计、以及 root 等待时机与模式耦合的细节。建议重点关注 `_multi_sender_ranks` 与 `build_topology` 的成员判定逻辑、`split_weight_chunks(meta_only=True)` 的复用方案,以及 review 中关于"边界分叉会导致广播永久挂起"的讨论。合并后建议跟进两件事:修正 `multi_sender` 默认值与 docstring、PR 描述不一致的问题;补充多节点与死锁回归测试。