Prhub

#49911 [CI][ROCm] Keep global GPU memory cleanup opt-in

原始 PR 作者 AndreasKaratzas 合并时间 2026-07-27 11:19 文件变更 1 提交数 1 评论 0 代码增减 +3 / -7

执行摘要

AMD CI 全局 GPU 内存清理改为 opt-in

PR body 指出:函数作用域的 fixture 无法释放存活时间更长的 fixture 持有的内存,自动清理可能导致误判或 OOM。同时引用了 Buildkite CI 构建的失败日志作为参考。

建议 AMD CI 维护人员确认相关测试是否已正确设置 VLLM_TEST_CLEAN_GPU_MEMORY=1。此 PR 提供了合理的设计决策,值得阅读。

讨论亮点

无 review 讨论。Claude bot 自动评论提示 review 未运行。dllehr-amd 直接批准。

实现拆解

  1. 修改 _should_clean_gpu_memory_between_tests() 函数 (tests/conftest.py): 移除原有的三路分支,直接返回 os.getenv("VLLM_TEST_CLEAN_GPU_MEMORY", "0") == "1"
  2. 删除默认 ROCm 平台自动清理逻辑: 原代码中 current_platform.is_rocm() 的检查被移除,不再为 AMD CI 自动启用清理。
  3. 保留有针对性的 teardown: 保留从 PR #49242 引入的 Qwen-VL 和 Nixl 相关特设清理,不受到影响。
文件 模块 状态 重要度
tests/conftest.py 测试配置 modified 4.84

关键符号

_should_clean_gpu_memory_between_tests

分析完成后,这里会展示 LLM 生成的相对完整源码片段和详细注释。

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

风险很低。变更仅限于测试基础设施的配置逻辑,不涉及核心推理、调度或模型代码。如果 AMD CI 中某些测试依赖自动清理来避免 OOM,则需要显式设置环境变量,否则可能引入测试失败,但 PR 明确为 opt-in 且已有针对性的 teardown。

直接影响 AMD CI 上的测试环境:原本自动执行的 GPU 内存清理现在需要手动设置环境变量。影响范围小,仅限测试配置。非 ROCm 平台不受影响。

测试基础设施变更 需确认 CI 设置

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论