执行摘要
修复 NPU 环境下 split_resource_pool 的设备名设置,避免 Ray 自动扩展失败。
PR body中指出,当设置distillation.teacher_model.enable_resource_pool=True时,TeacherModelManager会调用split_resource_pool。在NPU环境中,get_placement_groups()默认设备名为'cuda',导致Ray autoscaler失败。原因是Ray actor中可能无法直接检测到NPU设备,因此需要使用is_torch_npu_available来正确识别环境。
建议关注此PR,以了解如何在Ray actor中正确处理设备检测。对于类似代码,考虑采纳gemini的建议,将设备检测逻辑中心化,并添加相应测试以确保覆盖,以提高代码质量和维护性。
Review中主要有两个自动生成的评论:Copilot指出现有测试可能未覆盖新逻辑,建议添加测试以捕获NPU环境回归;gemini-code-assist[bot]建议将设备检测逻辑中心化到verl.utils.device中以提高代码一致性。这两个评论未得到回复,PR已被合并,没有实质性的人工讨论或争议。
参与讨论