执行摘要
修复 DeepSeek V2-Lite 预取卸载评估脚本默认配置
确保定时运行的 DeepSeek V2-Lite 预取卸载准确性评估(H100-MI300)具有确定性,避免因模型 HF 生成默认值差异导致的非确定性结果。该评估用于 ROCm CI 中的回归检测。
该 PR 简单且经过充分审查,可以合并。不需要进一步审查。
该 PR 没有来自人工审查者的实质性讨论。机器人审查者(Claude、Gemini)未提供与变更相关的反馈。
确保定时运行的 DeepSeek V2-Lite 预取卸载准确性评估(H100-MI300)具有确定性,避免因模型 HF 生成默认值差异导致的非确定性结果。该评估用于 ROCm CI 中的回归检测。
该 PR 简单且经过充分审查,可以合并。不需要进一步审查。
该 PR 没有来自人工审查者的实质性讨论。机器人审查者(Claude、Gemini)未提供与变更相关的反馈。
在 .buildkite/scripts/scheduled_integration_test/deepseek_v2_lite_prefetch_offload.sh 脚本的 vllm serve 命令中添加 --generation-config vllm 标志。该标志强制 vLLM 使用内置生成配置,而不是依赖模型自身的 Hugging Face 默认值。
| 文件 | 模块 | 状态 | 重要度 |
|---|---|---|---|
.buildkite/scripts/scheduled_integration_test/deepseek_v2_lite_prefetch_offload.sh |
CI 脚本 | modified | 3.11 |
.buildkite/scripts/scheduled_integration_test/deepseek_v2_lite_prefetch_offload.sh
test-coverage
添加 `--generation-config vllm` 标志,以使用 vLLM 默认值进行确定性评估。
# ── Build optional vllm serve flags ─────────────────────────────────────
EXTRA_ARGS=()
if [[ -n "${ATTENTION_BACKEND:-}" ]]; then
echo "Using attention backend: ${ATTENTION_BACKEND}"
EXTRA_ARGS+=(--attention-backend "${ATTENTION_BACKEND}")
fi
# ... cleanup function ...
vllm serve "$MODEL" \
--max-model-len 2048 \
--offload-group-size 8 \
--offload-num-in-group 2 \
--offload-prefetch-step 1 \
--offload-params w13_weight w2_weight \
--generation-config vllm \ # <--- 新增 : 使用 vLLM 生成默认值而非模型的 HF 默认值
--port "$PORT" \
${EXTRA_ARGS+"${EXTRA_ARGS[@]}"} &
SERVER_PID=$!
wait_for_server "$PORT"
# ... 运行 GSM8K 评估并检查准确性阈值 ...
当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。
风险极低。变更仅影响 ROCm 上 DeepSeek V2-Lite 预取卸载的定时评估脚本,不涉及生产代码或核心推理路径。
影响范围仅限于 ROCm CI 中的定时评估脚本,使其在 GSM8K 评估中行为确定。不会影响用户或系统行为。
当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。
参与讨论