执行摘要
清理 ROCm CI 冗余测试组并优化硬件分配
MI250 集群上运行着一些本应由更现代 AMD 硬件(如 MI300)执行的测试组,同时为了缓解 MI250 和 MI355 集群的压力,需要将部分测试组迁移到 MI300 集群,并清理冗余定义。
该 PR 为常规基础设施清理,变更直接、风险低,值得快速合并。对于关注 ROCm CI 效率的团队,可以了解硬件分配策略。
该 PR 没有 review 评论,直接获得批准。
MI250 集群上运行着一些本应由更现代 AMD 硬件(如 MI300)执行的测试组,同时为了缓解 MI250 和 MI355 集群的压力,需要将部分测试组迁移到 MI300 集群,并清理冗余定义。
该 PR 为常规基础设施清理,变更直接、风险低,值得快速合并。对于关注 ROCm CI 效率的团队,可以了解硬件分配策略。
该 PR 没有 review 评论,直接获得批准。
.buildkite/test-amd.yaml 中所有测试组定义,识别出适合从 MI250 转移到 MI300 的测试组。mirror_hardwares 字段:将 Pipeline + Context Parallelism (4 GPUs) 等测试组的硬件列表从包含 MI250 改为仅包含 MI300 等现代硬件。PyTorch Fullgraph、PyTorch Fullgraph Smoke Test、Elastic EP Scaling Test、EPLB Execution、Multi-Modal Accuracy Eval 等,这些测试或已不再需要,或已在更合适的位置运行。| 文件 | 模块 | 状态 | 重要度 |
|---|---|---|---|
.buildkite/test-amd.yaml |
CI 配置 | modified | 5.41 |
分析完成后,这里会展示 LLM 生成的相对完整源码片段和详细注释。
当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。
主要风险在于删除的测试组可能仍有覆盖需求,但 PR 作者明确说明这些组应仅在更现代硬件上运行,且部分测试已迁移。若后续发现缺失,可随时通过恢复或补充其它配置来弥补。由于只涉及 CI 编排,不影响任何运行时逻辑,回归风险极低。
对用户无影响;对 ROCm CI 系统而言,MI250 集群负载将减轻,MI300 集群资源利用率提升;测试执行策略更加合理,有助于缩短 CI 排队时间。影响范围限定于 AMD GPU CI 流水线。
当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。
参与讨论