# PR #27342 完整报告

- 仓库：`sgl-project/sglang`
- 标题：test: fix gemma GSM8K thresholds in nightly text eval
- 合并时间：2026-06-09 10:58
- 原文链接：http://prhub.com.cn/sgl-project/sglang/pull/27342

---

# 执行摘要

- 一句话：修正 Gemma 模型 GSM8K 阈值
- 推荐动作：该 PR 属于低风险、高收益的测试维护操作，适合快速合并。值得关注的点是：对比作者在 PR 描述中提供了详细的实验测量方法和数据（10 次完整 GSM8K 运行，明确的硬件和软件配置，清晰的阈值推导公式），这一做法值得在类似测试阈值调整中推广。无需精读代码，但可作为测试基础设施维护的参考。

# 功能与动机

在 PR #21931 将夜间评估套件从 `mgsm_en` 迁移到 `gsm8k` 后，两个 Gemma 模型的阈值直接引用了论文数据，但从未在实际的 SGLang 推理栈上验证。这导致 `google/gemma-2-27b-it` 的阈值过高（0.86），每次运行都静默失败约 0.5 个百分点；而 `neuralmagic/gemma-2-2b-it-FP8` 的阈值（0.38）基于过低的论文基线（约 43%），低估了该 FP8 变体在标准 5-shot CoT GSM8K 评估中的实际精度。

# 实现拆解

该 PR 的变更范围很小，仅涉及一个测试配置文件中的两行阈值修改：

1. **调整 `google/gemma-2-27b-it` 的阈值**：从 0.86 降低到 0.81。原阈值基于论文报告的 90.7% 减去 5%，而实际测量均值仅为 85.5%（10 次完整 GSM8K 运行，标准差 0.0015），新阈值反映了实际性能。

2. **调整 `neuralmagic/gemma-2-2b-it-FP8` 的阈值**：从 0.38 提高到 0.53。原阈值基于约 43% 的论文基线，而实际测量均值为 58.4%（10 次完整 GSM8K 运行，标准差 0.0044），新阈值基于实测均值的 95%（58.4% - 5%）。

3. **清理注释**：删除了与旧 MGSM-EN 基线相关的注释（包括指向 issue #4324 的链接），因为该上下文已不再适用。

测量条件：单台 H200，FA3 后端，FP16/FP8 格式，每轮运行间执行 `/flush_cache`，使用 1024 线程的聊天 API，5-shot CoT 提示。新阈值设置在实测最小值下方约 3 个标准差再加 5 个百分点，因此超过约 3pp 的回归将触发告警。

关键文件：
- `test/registered/eval/test_text_models_gsm8k_eval.py`（模块 测试；类别 test；类型 test-coverage）: 唯一变更文件，修改了两个 Gemma 模型的 GSM8K 评估阈值，直接影响夜间 CI 的通过状态。

关键符号：未识别

## 关键源码片段

### `test/registered/eval/test_text_models_gsm8k_eval.py`

唯一变更文件，修改了两个 Gemma 模型的 GSM8K 评估阈值，直接影响夜间 CI 的通过状态。

```python
# test/registered/eval/test_text_models_gsm8k_eval.py ( 关键变更部分 )

MODEL_SCORE_THRESHOLDS = {
    # 阈值基于实测 GSM8K (5-shot/CoT) 均值的 95%
    "meta-llama/Llama-3.1-8B-Instruct": 0.80,  # 84.5% - 5%
    # ... 其他条目不变 ...
    # 变更 1：google/gemma-2-27b-it 阈值从 0.86 降至 0.81
    "google/gemma-2-27b-it": 0.81,  # 实测均值 85.5% - 5%
    # ... 其他条目不变 ...
    # 变更 2：neuralmagic/gemma-2-2b-it-FP8 阈值从 0.38 升至 0.53
    # 原阈值基于论文 ~43%，实测该 FP8 变体可达 58.4%
    "neuralmagic/gemma-2-2b-it-FP8": 0.53,  # 实测均值 58.4% - 5%
    # ... 其余条目不变 ...
}

```

# 评论区精华

该 PR 的 review 过程中没有出现实质性讨论或争议。唯一与 PR 相关的评论来自 CI 触发命令（`/rerun-test`），表明审核者专注于验证变更是否正确。PR 作者通过详细的 PR 描述和测量数据提供了充分的证据，因此未出现设计分歧。

- 暂无高价值评论线程

# 风险与影响

- 风险：风险极低。变更仅涉及两个模型的数值阈值和关联注释，不触及任何运行时逻辑、模型加载或推理代码。阈值调整带来的主要风险是：当模型精度真正回归时，新阈值（27b: 0.81，2b: 0.53）可能无法及时检测到轻微退化，但作者已通过将阈值设置在实测最小值下方约 3 个标准差来缓解此风险，确保只有超过约 3pp 的显著回归才会触发失败。不存在回归、性能、安全或兼容性风险。
- 影响：影响范围仅限于夜间评估套件中的两个 Gemma 模型条目。正面影响：`google/gemma-2-27b-it` 的测试将首次变为绿色（之前每次运行都静默失败），而 `neuralmagic/gemma-2-2b-it-FP8` 的测试也将具备合理的灵敏度，能够捕捉有意义的精度退化。对其他模型（如 Llama、Mistral、DeepSeek、Qwen 等）无影响。该变更对用户透明，仅影响 CI 门控。
- 风险标记：测试阈值调整 , 极小变更

# 关联脉络

- PR #21931 Migrate mgsm_en to gsm8k in nightly eval: 本 PR 修正的阈值正是在此 PR 迁移评估数据集时引入的，原阈值直接复制了论文基线，未在 SGLang 栈上验证。