#6069 [fully_async] fix: fix rollouter/idle compute in async-mode
原始 PR · 作者 chenjiaoAngel · 合并时间 2026-04-20 17:50
修复完全异步rollouter中空闲比计算逻辑,避免除零错误和时序不一致。
该PR代码简洁,修复了明确的边界条件问题,值得快速浏览以了解完全异步训练中监控指标的计算细节。重点关注`reset_staleness`方法中时间戳处理的改进方式。
verl: Volcano Engine Reinforcement Learning for LLMs
原始 PR · 作者 chenjiaoAngel · 合并时间 2026-04-20 17:50
修复完全异步rollouter中空闲比计算逻辑,避免除零错误和时序不一致。
该PR代码简洁,修复了明确的边界条件问题,值得快速浏览以了解完全异步训练中监控指标的计算细节。重点关注`reset_staleness`方法中时间戳处理的改进方式。
修复NPU训练脚本参数,移除冗余环境变量并修正专家并行配置。
该PR值得快速浏览以了解NPU训练脚本的配置细节,但不需要深入研读。重点关注review中关于`enable_expert_parallel`参数无效的讨论,这揭示了vLLM引擎配置参数的实际生效机制。对于需要在NPU上启用专家并行的用户,应该参考review建议设置`expert_parallel_size`参数。
原始 PR · 作者 MaxwellJryao · 合并时间 2026-04-20 17:10
修复KL散度惩罚函数中带'+'后缀的估计器因未剥离后缀而抛出NotImplementedError的长期bug。
该PR值得精读,因为它揭示了一个长期存在的核心算法bug及其简洁的修复方案。重点关注`kl_penalty`函数中直通梯度技巧的实现逻辑,以及如何通过剥离后缀确保调度正确。新增的测试展示了如何验证直通梯度技巧的正确性,可作为类似测试的参考。
原始 PR · 作者 xiaohong42 · 合并时间 2026-04-20 16:26
修复完全异步FSDP2训练在AMD ROCm平台(MI300X系列)的兼容性问题。
该PR值得精读,特别是ZMQ IPC句柄重构的设计决策,它展示了如何通过平台无关的rank算术解决硬件特定的通信不匹配问题。建议关注`_get_zmq_handle`方法的实现和讨论中关于错误处理与Actor命名的权衡。
修复完全异步训练在Ascend NPU上因MindSpeed补丁未应用导致的torch_npu错误。
该PR值得精读,特别是对于在Ascend NPU上使用完全异步训练的开发者。关注点包括: - **设计决策**:将策略处理器改为属性方法以控制导入顺序,这是一种常见的延迟初始化模式,适用于依赖外部补丁的场景。 - **代码组织**:注意review中提到的补丁位置重构建议,这可能影响未来代码维护。 - **关联风险**:了解`init_model`中未解决的配置访问问题,避免在非Megatron策略下误用。
为TRT-LLM rollout后端新增跨节点推理支持,并补充测试和CI集成。
建议精读 `trtllm_async_server.py` 中 `get_pgs_and_bundle_indices` 方法的修改,理解跨节点资源分配的逻辑;同时关注新增的集成测试,了解如何在多节点场景下验证TRT-LLM rollout功能。
修复完全异步训练器中同步Ray调用阻塞事件循环的问题。
该PR值得精读,特别是对于使用Ray异步Actor的开发者。关注点包括:1) 如何正确地将同步Ray调用迁移到异步以避免阻塞;2) 使用`asyncio.wrap_future`处理Ray远程future的模式;3) 讨论中关于`None`处理的设计权衡,展示了实际开发中边界条件处理的优先级决策。
原始 PR · 作者 JacobHelwig · 合并时间 2026-04-20 12:31
实现多教师在线策略蒸馏框架
建议所有涉及蒸馏功能或资源编排的工程师精读此 PR。核心设计模式(资源池分割、请求路由、配置数据契约)值得借鉴。特别关注 `_validate_replica_node_alignment` 和 `_resolve_teacher_key` 的实现,它们体现了对多节点部署的严谨考虑。在部署多教师场景前,建议增加集成测试覆盖节点对齐和路由降级路径。
参与讨论