Prhub

#24325 rerun-test: route deepep h200 suite to deepep runner

原始 PR 作者 hnyls2002 合并时间 2026-05-04 06:57 文件变更 2 提交数 2 评论 0 代码增减 +4 / -1

执行摘要

重路由 deepep H200 测试到对应 runner

PR body 明确指出:需要匹配 pr-test.yml 中 stage-c-test-deepep-8-gpu-h200 阶段使用的 runner(8-gpu-h200-deepep),以便 rerun-test 能够在该套件上使用与原始 PR job 相同的硬件。

该 PR 属于标准 CI 维护操作,值得关注的是临时环境变量的清理 —— 建议在合并到 main 前移除或确认其必要性。

讨论亮点

仅有一条来自 gemini-code-assist[bot] 的自动评论,表示代码审查无反馈。无人工 reviewer 参与。

实现拆解

  1. .github/workflows/rerun-test.yml 的 runner 列表中新增 8-gpu-h200-deepep,并添加临时环境变量 FORCE_REBUILD_DEEPEP 以在 Torch 升级时强制重建 DeepEP(仅为临时措施,合并前需回退)。
  2. scripts/ci/utils/slash_command_handler.py 中将 stage-c-test-deepep-8-gpu-h200 对应的硬件标识从 8-gpu-h200 修改为 8-gpu-h200-deepep,使 rerun 命令路由到正确的 runner。
文件 模块 状态 重要度
.github/workflows/rerun-test.yml CI 配置 modified 3.08
scripts/ci/utils/slash_command_handler.py CI 脚本 modified 2.92

关键符号

handle_rerun_stage

分析完成后,这里会展示 LLM 生成的相对完整源码片段和详细注释。

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

风险极低。仅为 CI 配置变更,不影响任何业务逻辑。但临时环境变量 FORCE_REBUILD_DEEPEP 需确保在主分支合并前移除,否则可能导致 CI 中不必要的重建。

影响范围仅限于 rerun-test 工作流中 deepep 相关测试阶段。正确路由后,rerun-test 能使用专用 runner,可避免因硬件不同导致的测试失败或性能差异。

临时环境变量需清理

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论