Prhub

#49243 [CI] Add gemma-4-E4B-it-assistant to CI gsm8k for GemmaMTP

原始 PR 作者 mgoin 合并时间 2026-07-22 04:51 文件变更 1 提交数 2 评论 0 代码增减 +4 / -1

执行摘要

为 GemmaMTP 添加 GSM8K 评测配置

PR body 明确说明:"To better cover against regression like https://github.com/vllm-project/vllm/pull/47953",即防止 speculative decoding 中 embedding 宽度检查误伤 MTP Draft 的问题再次出现。

可直接合并。对于关注 speculative decoding 或 Gemma 模型的开发者,值得了解此配置作为参考。

讨论亮点

无讨论。PR 被 tlrmchlsmth 直接批准。

实现拆解

修改 tests/evals/gsm8k/configs/gemma-4-E4B-it-qat-mobile-ct.yaml,在 server_args 中追加 --speculative-config 参数,启用 Multi-Token Prediction(MTP)模式,指定辅助模型为 google/gemma-4-E4B-it-assistant,并设置 num_speculative_tokens=4

文件 模块 状态 重要度
tests/evals/gsm8k/configs/gemma-4-E4B-it-qat-mobile-ct.yaml 评测配置 modified 4.1

关键源码片段

tests/evals/gsm8k/configs/gemma-4-E4B-it-qat-mobile-ct.yaml test-coverage

唯一变更文件,为 GemmaMTP 模型添加了 MTP 辅助模型的 GSM8K 评测配置,用于回归测试。

# tests/evals/gsm8k/configs/gemma-4-E4B-it-qat-mobile-ct.yaml
# 本配置为 Gemma 4 E4B 模型(已量化移动版)添加 MTP speculative decoding 评测
model_name: "google/gemma-4-E4B-it-qat-mobile-ct"
accuracy_threshold: 0.50 # 准确率阈值
num_questions: 1319 # 评测问题数
num_fewshot: 5 # few-shot 样例数
server_args: >-
  --enforce-eager
  --max-model-len 4096
  --speculative-config '{"method":"mtp","model":"google/gemma-4-E4B-it-assistant","num_speculative_tokens":4}'
  # 启用 MTP 推测解码,使用专门的 assistant 模型,每次推测 4 个 token

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

风险极低。仅修改了评测配置,不会影响任何生产代码或核心逻辑。唯一风险是该配置若在 CI 中运行失败可能导致误报,但通过调整 accuracy_threshold 可缓解。

影响范围极小,仅限于 CI 中的 GSM8K 评测流水线。有助于提高 GemmaMTP 模型的回归测试覆盖率。

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论