Prhub

#47094 [ROCm][CI] Move LM Eval Large Models (8 GPUs) to mi300 pool

原始 PR 作者 peizhang56 合并时间 2026-06-30 09:59 文件变更 1 提交数 1 评论 1 代码增减 +21 / -21

执行摘要

LM Eval 8 卡测试从 mi325 迁至 mi300 池

将 8 GPU LM-eval 测试从 mi325 池迁移到 mi300 池,以释放 mi325 资源并集中管理 mi300 上的评估任务。评审者 AndreasKaratzas 明确指出:"We moved this to empty the MI325 queue and reuse it elsewhere"。

可直接合并。此 PR 为纯基础设施配置调整,变更简单且已获批准。推荐 CI 维护者关注迁移后测试是否在 mi300 池顺利调度。

讨论亮点

无实质性讨论。Claude 自动评论因 PR 来自 fork 而禁用审核;AndreasKaratzas 直接批准并说明动机是清空 mi325 队列以复用资源。

实现拆解

  1. 在 mi300 区域新增步骤:在 .buildkite/test-amd.yaml 的 mi300 章节中,紧接现有 "LM Eval Large Models (8xH200-8xMI300)" 步骤之后,插入原属于 mi325 的 "ROCm LM Eval Large Models (8 GPUs)" 步骤,mirror_hardwaresagent_pool 修改为 amdmi300mi300_8
  2. 从 mi325 区域删除原步骤:移除 mi325 章节中同名的旧步骤配置块(mirror_hardwares: [amdmi325], agent_pool: mi325_8)。
  3. 保持所有其他参数不变:包括 timeout_in_minutes: 180num_gpus: 8working_dirsource_file_dependenciescommands(仍执行 test_lm_eval_correctness.py --config-list-file=configs/models-large-rocm.txt --tp-size=8)和 optional: true
文件 模块 状态 重要度
.buildkite/test-amd.yaml CI 配置 modified 4.66

分析完成后,这里会展示 LLM 生成的相对完整源码片段和详细注释。

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

  • 低风险:仅为 YAML 配置变更,未修改任何代码或测试逻辑。
  • 潜在回归:如果 mi300 8 卡池的 GPU 型号、驱动或环境配置与预期不符,测试可能失败,但已有其他 mi300 步骤运行正常,风险极低。
  • 容量影响:将 8 卡评测迁移至 mi300 后,该池负载增加,可能影响该池其他任务的调度。
  • 影响范围:仅限 ROCm CI 的 LM-eval 8 卡测试步骤。
  • 影响程度:低。测试行为完全不变,硬件池迁移不会改变测试结果。
  • 团队影响:CI 维护者通过集中管理 mi300 上的评估工作,可更灵活分配 mi325 资源。
低风险配置变更

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论