执行摘要
- 一句话:修正 Gemma 模型 GSM8K 阈值
- 推荐动作:该 PR 属于低风险、高收益的测试维护操作,适合快速合并。值得关注的点是:对比作者在 PR 描述中提供了详细的实验测量方法和数据(10 次完整 GSM8K 运行,明确的硬件和软件配置,清晰的阈值推导公式),这一做法值得在类似测试阈值调整中推广。无需精读代码,但可作为测试基础设施维护的参考。
功能与动机
在 PR #21931 将夜间评估套件从 mgsm_en 迁移到 gsm8k 后,两个 Gemma 模型的阈值直接引用了论文数据,但从未在实际的 SGLang 推理栈上验证。这导致 google/gemma-2-27b-it 的阈值过高(0.86),每次运行都静默失败约 0.5 个百分点;而 neuralmagic/gemma-2-2b-it-FP8 的阈值(0.38)基于过低的论文基线(约 43%),低估了该 FP8 变体在标准 5-shot CoT GSM8K 评估中的实际精度。
实现拆解
该 PR 的变更范围很小,仅涉及一个测试配置文件中的两行阈值修改:
-
调整 google/gemma-2-27b-it 的阈值:从 0.86 降低到 0.81。原阈值基于论文报告的 90.7% 减去 5%,而实际测量均值仅为 85.5%(10 次完整 GSM8K 运行,标准差 0.0015),新阈值反映了实际性能。
-
调整 neuralmagic/gemma-2-2b-it-FP8 的阈值:从 0.38 提高到 0.53。原阈值基于约 43% 的论文基线,而实际测量均值为 58.4%(10 次完整 GSM8K 运行,标准差 0.0044),新阈值基于实测均值的 95%(58.4% - 5%)。
-
清理注释:删除了与旧 MGSM-EN 基线相关的注释(包括指向 issue #4324 的链接),因为该上下文已不再适用。
测量条件:单台 H200,FA3 后端,FP16/FP8 格式,每轮运行间执行 /flush_cache,使用 1024 线程的聊天 API,5-shot CoT 提示。新阈值设置在实测最小值下方约 3 个标准差再加 5 个百分点,因此超过约 3pp 的回归将触发告警。
关键文件:
test/registered/eval/test_text_models_gsm8k_eval.py(模块 测试;类别 test;类型 test-coverage): 唯一变更文件,修改了两个 Gemma 模型的 GSM8K 评估阈值,直接影响夜间 CI 的通过状态。
关键符号:未识别
关键源码片段
test/registered/eval/test_text_models_gsm8k_eval.py
唯一变更文件,修改了两个 Gemma 模型的 GSM8K 评估阈值,直接影响夜间 CI 的通过状态。
# test/registered/eval/test_text_models_gsm8k_eval.py ( 关键变更部分 )
MODEL_SCORE_THRESHOLDS = {
# 阈值基于实测 GSM8K (5-shot/CoT) 均值的 95%
"meta-llama/Llama-3.1-8B-Instruct": 0.80, # 84.5% - 5%
# ... 其他条目不变 ...
# 变更 1:google/gemma-2-27b-it 阈值从 0.86 降至 0.81
"google/gemma-2-27b-it": 0.81, # 实测均值 85.5% - 5%
# ... 其他条目不变 ...
# 变更 2:neuralmagic/gemma-2-2b-it-FP8 阈值从 0.38 升至 0.53
# 原阈值基于论文 ~43%,实测该 FP8 变体可达 58.4%
"neuralmagic/gemma-2-2b-it-FP8": 0.53, # 实测均值 58.4% - 5%
# ... 其余条目不变 ...
}
评论区精华
该 PR 的 review 过程中没有出现实质性讨论或争议。唯一与 PR 相关的评论来自 CI 触发命令(/rerun-test),表明审核者专注于验证变更是否正确。PR 作者通过详细的 PR 描述和测量数据提供了充分的证据,因此未出现设计分歧。
风险与影响
- 风险:风险极低。变更仅涉及两个模型的数值阈值和关联注释,不触及任何运行时逻辑、模型加载或推理代码。阈值调整带来的主要风险是:当模型精度真正回归时,新阈值(27b: 0.81,2b: 0.53)可能无法及时检测到轻微退化,但作者已通过将阈值设置在实测最小值下方约 3 个标准差来缓解此风险,确保只有超过约 3pp 的显著回归才会触发失败。不存在回归、性能、安全或兼容性风险。
- 影响:影响范围仅限于夜间评估套件中的两个 Gemma 模型条目。正面影响:
google/gemma-2-27b-it 的测试将首次变为绿色(之前每次运行都静默失败),而 neuralmagic/gemma-2-2b-it-FP8 的测试也将具备合理的灵敏度,能够捕捉有意义的精度退化。对其他模型(如 Llama、Mistral、DeepSeek、Qwen 等)无影响。该变更对用户透明,仅影响 CI 门控。
- 风险标记:测试阈值调整, 极小变更
关联脉络
- PR #21931 Migrate mgsm_en to gsm8k in nightly eval: 本 PR 修正的阈值正是在此 PR 迁移评估数据集时引入的,原阈值直接复制了论文基线,未在 SGLang 栈上验证。
参与讨论