Prhub

#46018 [Hardware][AMD][CI] Fix Spec Decode Eagle test group

原始 PR 作者 mawong-amd 合并时间 2026-06-22 06:40 文件变更 3 提交数 2 评论 0 代码增减 +17 / -2

执行摘要

修复 AMD CI 中 Spec Decode Eagle 测试组

PR body 明确指出 'fixes the Spec Decode Eagle test group',目的是使该测试在 AMD CI 中正确通过。

可直接合入。对关注 AMD 平台测试的团队有一定参考价值。

讨论亮点

无 review 讨论。

实现拆解

  1. 配置更新:在 .buildkite/test_areas/spec_decode.yaml 中为 Spec Decode Eagle 步骤添加了 AMD 镜像配置,指定设备 mi325_1、超时 45 分钟,并扩展文件依赖以覆盖 ROCm 相关模块。
  2. 测试修复:在 tests/v1/e2e/spec_decode/test_spec_decode.py 中,将 DeepSeek 模型的注意力后端从 TRITON_MLA 改为 ROCM_AITER_MLA,以匹配 AITER 环境。
  3. CI 调整:在 .buildkite/test-amd.yaml 中,将 Spec Decode Eagle 步骤的超时从 180 分钟缩短为 45 分钟,并标记为 optional: true,避免阻塞 CI 流水线。
文件 模块 状态 重要度
.buildkite/test_areas/spec_decode.yaml CI 配置 modified 4.05
tests/v1/e2e/spec_decode/test_spec_decode.py 推测解码 modified 3.7
.buildkite/test-amd.yaml CI 配置 modified 3.28

关键源码片段

tests/v1/e2e/spec_decode/test_spec_decode.py test-coverage

修复了 DeepSeek 模型在 AITER 环境下的注意力后端配置。

# tests/v1/e2e/spec_decode/test_spec_decode.py
# 在 AITER 环境下,DeepSeek 模型应使用 ROCM_AITER_MLA 而非 TRITON_MLA
with monkeypatch.context() as m:
    m.setenv("VLLM_MLA_DISABLE", "1")
​
    if attn_backend == "ROCM_AITER_FA" and current_platform.is_rocm():
        if "deepseek" in model_setup[1].lower():
            m.setenv("VLLM_ROCM_USE_AITER", "1")
            m.delenv("VLLM_MLA_DISABLE", raising=False)
            # 修复:使用正确的 AITER MLA 后端
            attention_config = {"backend": "ROCM_AITER_MLA"}
        else:
            m.setenv("VLLM_ROCM_USE_AITER", "1")

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

低风险。变更仅限于 CI 配置和测试参数调整,不影响核心推理逻辑。注意力后端切换为 ROCM_AITER_MLA 可能影响 DeepSeek 模型在 ROCm 上的 Eagle 测试结果,但已通过测试验证。

仅影响 AMD CI (ROCm) 中的 Spec Decode Eagle 测试组,使其能够正确运行并通过。不涉及用户侧或生产环境。

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论