执行摘要
将 GLM-4.1V-9B-Thinking 移出 nightly MMMU 评测
PR 描述指出 GLM-4.1V-9B-Thinking 在 nightly VLM MMMU 评测中因延迟 37.31s 超过 35.5s 阈值而失败,准确率虽达标但仍需移除,以避免持续告警。
该 PR 为简单的测试配置调整,不值得精读,用于了解 CI 评测的阈值管理方式。
Review 中 mmangkad 直接批准,无任何评论或讨论。
PR 描述指出 GLM-4.1V-9B-Thinking 在 nightly VLM MMMU 评测中因延迟 37.31s 超过 35.5s 阈值而失败,准确率虽达标但仍需移除,以避免持续告警。
该 PR 为简单的测试配置调整,不值得精读,用于了解 CI 评测的阈值管理方式。
Review 中 mmangkad 直接批准,无任何评论或讨论。
该 PR 只修改了测试文件 test/registered/eval/test_vlms_mmmu_eval.py,删除了 MODEL_THRESHOLDS 字典中关于 zai-org/GLM-4.1V-9B-Thinking 的条目。具体为删除一行代码,无其他改动,没有测试或配置配套变更。
| 文件 | 模块 | 状态 | 重要度 |
|---|---|---|---|
test/registered/eval/test_vlms_mmmu_eval.py |
评测 | modified | 2.71 |
test/registered/eval/test_vlms_mmmu_eval.py
test-coverage
移除 GLM-4.1V-9B-Thinking 的延迟阈值条目,影响 nightly MMMU 评测的模型列表。
# MODEL_THRESHOLDS 字典的部分内容,删除了一行模型配置
MODEL_THRESHOLDS = {
...
ModelLaunchSettings("unsloth/Mistral-Small-3.1-24B-Instruct-2503"): (0.30, 43.0),
ModelLaunchSettings("XiaomiMiMo/MiMo-VL-7B-RL"): (0.28, 40.0),
# 删除行 : ModelLaunchSettings("zai-org/GLM-4.1V-9B-Thinking"): (0.280, 35.5),
ModelLaunchSettings("zai-org/GLM-4.5V-FP8", extra_args=["--tp=2"]): (0.26, 140.0),
}
当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。
风险极低,仅影响 nightly MMMU 评测的模型覆盖范围,移除后该模型不再被评测,可能掩盖未来性能退化。但不会影响其他模型的评测或生产代码。
对用户无直接影响,对 CI 系统:nightly MMMU 评测不再包含该模型,减少一个失败点。对团队:需要关注该模型后续性能,必要时重新引入。
当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。
参与讨论