Prhub

#41575 [ROCm][CI] Use vLLM generation defaults for DeepSeek prefetch-offload eval

原始 PR 作者 AndreasKaratzas 合并时间 2026-05-06 09:08 文件变更 1 提交数 1 评论 0 代码增减 +1 / -0

执行摘要

修复 DeepSeek V2-Lite 预取卸载评估脚本默认配置

确保定时运行的 DeepSeek V2-Lite 预取卸载准确性评估(H100-MI300)具有确定性,避免因模型 HF 生成默认值差异导致的非确定性结果。该评估用于 ROCm CI 中的回归检测。

该 PR 简单且经过充分审查,可以合并。不需要进一步审查。

讨论亮点

该 PR 没有来自人工审查者的实质性讨论。机器人审查者(Claude、Gemini)未提供与变更相关的反馈。

实现拆解

.buildkite/scripts/scheduled_integration_test/deepseek_v2_lite_prefetch_offload.sh 脚本的 vllm serve 命令中添加 --generation-config vllm 标志。该标志强制 vLLM 使用内置生成配置,而不是依赖模型自身的 Hugging Face 默认值。

文件 模块 状态 重要度
.buildkite/scripts/scheduled_integration_test/deepseek_v2_lite_prefetch_offload.sh CI 脚本 modified 3.11

关键源码片段

.buildkite/scripts/scheduled_integration_test/deepseek_v2_lite_prefetch_offload.sh test-coverage

添加 `--generation-config vllm` 标志,以使用 vLLM 默认值进行确定性评估。

# ── Build optional vllm serve flags ─────────────────────────────────────EXTRA_ARGS=()
if [[ -n "${ATTENTION_BACKEND:-}" ]]; then
  echo "Using attention backend: ${ATTENTION_BACKEND}"
  EXTRA_ARGS+=(--attention-backend "${ATTENTION_BACKEND}")
fi# ... cleanup function ...
​
vllm serve "$MODEL" \
  --max-model-len 2048 \
  --offload-group-size 8 \
  --offload-num-in-group 2 \
  --offload-prefetch-step 1 \
  --offload-params w13_weight w2_weight \
  --generation-config vllm \  # <--- 新增 : 使用 vLLM 生成默认值而非模型的 HF 默认值
  --port "$PORT" \
  ${EXTRA_ARGS+"${EXTRA_ARGS[@]}"} &
SERVER_PID=$!
wait_for_server "$PORT"# ... 运行 GSM8K 评估并检查准确性阈值 ...

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

风险极低。变更仅影响 ROCm 上 DeepSeek V2-Lite 预取卸载的定时评估脚本,不涉及生产代码或核心推理路径。

影响范围仅限于 ROCm CI 中的定时评估脚本,使其在 GSM8K 评估中行为确定。不会影响用户或系统行为。

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论