#6777 [hardware] refactor: per-model NPU patches with fault isolation
原始 PR · 作者 tardis-key · 合并时间 2026-06-23 15:17
通过按模型隔离重构 NPU 补丁,避免单模型缺失导致全部补丁失效
该 PR 值得精读,特别是注册表+延迟导入的错误隔离模式,对需要加载多个可选模块的场景有参考意义。建议关注其后续是否添加 rank 0 日志控制。
verl: Volcano Engine Reinforcement Learning for LLMs
原始 PR · 作者 tardis-key · 合并时间 2026-06-23 15:17
通过按模型隔离重构 NPU 补丁,避免单模型缺失导致全部补丁失效
该 PR 值得精读,特别是注册表+延迟导入的错误隔离模式,对需要加载多个可选模块的场景有参考意义。建议关注其后续是否添加 rank 0 日志控制。
修复 Ascend CI 中 Megatron 和 Bridge 版本
建议快速合并以修复 CI。
为 vLLM rollout 和 reward model 增加完全确定性支持,实现端到端可重现训练
该 PR 值得精读,尤其是以下几点设计决策:1)确定性路由使用 `hash(request_id)` 而非 random 选择,确保跨运行时一致;2)以 priority 作为 request_id 的基础,避免 `uuid4()` 引入的随机性;3)RM 序列化作为 vLLM classify 路径不支持的妥协方案。建议团队在文档中明确说明确定性训练的限制(仅 single-turn Agent Loop、RM max_num_seqs=1、性能开销大),并在启用时使用专用的配置 profile。
Megatron优化器状态与DDP梯度桶对齐模型类型
该PR值得精读,尤其是精度感知优化器与DDP梯度桶的联动设计。对于关注显存优化的团队,建议评估后启用,并在各自任务上进行收敛性验证。
修复DAPO错误并为NPU nightly CI新增三个基线
值得合并以提升NPU CI的自动化检测能力。可关注后续夜间CI日志确认基线文件路径正确性,以及检查合并后的测试是否覆盖了原独立步骤的所有用例。
Continuous Token 多轮令牌持续化机制
值得精读。该 PR 是精心设计的架构演进,展示了如何优雅地处理多模型家族下的 tokenization 通用性。关键设计亮点包括:Builder 钩子模式、模型家族自动推断、两层验证检查器。建议在后续多模态支持和默认启用后再深入评估与旧路径一致性。
原始 PR · 作者 huaiyizhao · 合并时间 2026-06-22 14:31
修复 fully async trainer 指标日志偏移
该 PR 值得合并,修正了指标日志偏移问题。建议关注 Gemini 机器人的评论,确认 `_fit_postprocess_step` 是否真正负责指标聚合,必要时可后续调整调用顺序或增加单元测试覆盖指标日志逻辑。
新增 Ascend Qwen3.5-122B 长序列 GRPO 启动脚本
对于需要在大规模 Ascend 集群上运行 Qwen3.5-122B GRPO 训练的开发者,可直接参考此脚本进行调整。脚本中的环境标志和并行配置值得学习。
参与讨论