Prhub

#27342 test: fix gemma GSM8K thresholds in nightly text eval

原始 PR 作者 kpham-sgl 合并时间 2026-06-09 10:58 文件变更 1 提交数 2 评论 5 代码增减 +2 / -4

执行摘要

修正 Gemma 模型 GSM8K 阈值

在 PR #21931 将夜间评估套件从 mgsm_en 迁移到 gsm8k 后,两个 Gemma 模型的阈值直接引用了论文数据,但从未在实际的 SGLang 推理栈上验证。这导致 google/gemma-2-27b-it 的阈值过高(0.86),每次运行都静默失败约 0.5 个百分点;而 neuralmagic/gemma-2-2b-it-FP8 的阈值(0.38)基于过低的论文基线(约 43%),低估了该 FP8 变体在标准 5-shot CoT GSM8K 评估中的实际精度。

该 PR 属于低风险、高收益的测试维护操作,适合快速合并。值得关注的点是:对比作者在 PR 描述中提供了详细的实验测量方法和数据(10 次完整 GSM8K 运行,明确的硬件和软件配置,清晰的阈值推导公式),这一做法值得在类似测试阈值调整中推广。无需精读代码,但可作为测试基础设施维护的参考。

讨论亮点

该 PR 的 review 过程中没有出现实质性讨论或争议。唯一与 PR 相关的评论来自 CI 触发命令(/rerun-test),表明审核者专注于验证变更是否正确。PR 作者通过详细的 PR 描述和测量数据提供了充分的证据,因此未出现设计分歧。

实现拆解

该 PR 的变更范围很小,仅涉及一个测试配置文件中的两行阈值修改:

  1. 调整 google/gemma-2-27b-it 的阈值:从 0.86 降低到 0.81。原阈值基于论文报告的 90.7% 减去 5%,而实际测量均值仅为 85.5%(10 次完整 GSM8K 运行,标准差 0.0015),新阈值反映了实际性能。

  2. 调整 neuralmagic/gemma-2-2b-it-FP8 的阈值:从 0.38 提高到 0.53。原阈值基于约 43% 的论文基线,而实际测量均值为 58.4%(10 次完整 GSM8K 运行,标准差 0.0044),新阈值基于实测均值的 95%(58.4% - 5%)。

  3. 清理注释:删除了与旧 MGSM-EN 基线相关的注释(包括指向 issue #4324 的链接),因为该上下文已不再适用。

测量条件:单台 H200,FA3 后端,FP16/FP8 格式,每轮运行间执行 /flush_cache,使用 1024 线程的聊天 API,5-shot CoT 提示。新阈值设置在实测最小值下方约 3 个标准差再加 5 个百分点,因此超过约 3pp 的回归将触发告警。

文件 模块 状态 重要度
test/registered/eval/test_text_models_gsm8k_eval.py 测试 modified 4.16

关键源码片段

test/registered/eval/test_text_models_gsm8k_eval.py test-coverage

唯一变更文件,修改了两个 Gemma 模型的 GSM8K 评估阈值,直接影响夜间 CI 的通过状态。

# test/registered/eval/test_text_models_gsm8k_eval.py ( 关键变更部分 )MODEL_SCORE_THRESHOLDS = {
    # 阈值基于实测 GSM8K (5-shot/CoT) 均值的 95%
    "meta-llama/Llama-3.1-8B-Instruct": 0.80, # 84.5% - 5%
    # ... 其他条目不变 ...
    # 变更 1:google/gemma-2-27b-it 阈值从 0.86 降至 0.81
    "google/gemma-2-27b-it": 0.81, # 实测均值 85.5% - 5%
    # ... 其他条目不变 ...
    # 变更 2:neuralmagic/gemma-2-2b-it-FP8 阈值从 0.38 升至 0.53
    # 原阈值基于论文 ~43%,实测该 FP8 变体可达 58.4%
    "neuralmagic/gemma-2-2b-it-FP8": 0.53, # 实测均值 58.4% - 5%
    # ... 其余条目不变 ...
}

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

风险极低。变更仅涉及两个模型的数值阈值和关联注释,不触及任何运行时逻辑、模型加载或推理代码。阈值调整带来的主要风险是:当模型精度真正回归时,新阈值(27b: 0.81,2b: 0.53)可能无法及时检测到轻微退化,但作者已通过将阈值设置在实测最小值下方约 3 个标准差来缓解此风险,确保只有超过约 3pp 的显著回归才会触发失败。不存在回归、性能、安全或兼容性风险。

影响范围仅限于夜间评估套件中的两个 Gemma 模型条目。正面影响:google/gemma-2-27b-it 的测试将首次变为绿色(之前每次运行都静默失败),而 neuralmagic/gemma-2-2b-it-FP8 的测试也将具备合理的灵敏度,能够捕捉有意义的精度退化。对其他模型(如 Llama、Mistral、DeepSeek、Qwen 等)无影响。该变更对用户透明,仅影响 CI 门控。

测试阈值调整 极小变更

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论