Prhub

#36977 [Cookbook] Run accuracy benchmarks through sgl-eval

原始 PR 作者 hnyls2002 合并时间 2026-08-29 14:29 文件变更 3 提交数 2 评论 1 代码增减 +52 / -84

执行摘要

三份 cookbook 精度复现命令迁至 sgl-eval run

PR body 说明:重写 DeepSeek-V3.2、MiniMax-M2.7、Kimi-K2.6 页面的 AIME 2025、GPQA Diamond、MMLU-Pro 复现命令,改用 sgl-eval run(which ships the datasets, prompts and graders these numbers were produced with)。原复现依赖 NeMo-Skills 的 ns prepare_data、ns eval 及大量 ++inference 叠加参数,流程长且需要额外环境变量处理;迁移后一条命令即可在本地复现文档中的精度数字,降低复现门槛。

建议快速浏览:如需通过 sgl-eval 复现模型精度数字,本 PR 是标准示例,重点看三个页面的参数映射(seeds 到 --n-repeats、tokens_to_generate 到 --max-tokens、并发数到 --num-threads)与默认 prompt 处理;无需精读,不涉及架构或性能决策。

讨论亮点

本 PR 无实质性 review 讨论。唯一评论来自 mintlify[bot] 的自动预览提示,告知文档预览站点正在构建,不涉及技术内容;作者独立完成两笔提交并自行合并,无公开争议或设计权衡记录。从提交信息可推断,第二笔提交是自查中补齐了 MiniMax 页面遗漏的 MMLU-Pro 命令块。

实现拆解

  1. 变更入口:三份文件的 Accuracy Benchmark 小节整体替换评估工具说明与命令块,目标工具从 NVIDIA NeMo-Skills 切换为官方 sgl-eval。
  2. 各文件具体改动:
    - DeepSeek-V3_2.mdx(AIME 2025):ns eval --benchmarks=aime25:4 迁移为 sgl-eval run aime25 --n-repeats 4tokens_to_generate=64000 映射 --max-tokens 64000,保留 Speciale 模型 120000 token 注释,删除 NEMO_SKILLS_DISABLE_UNCOMMITTED_CHANGES_CHECK 环境变量。
    - MiniMax-M2.7.mdx(GPQA、AIME、MMLU-Pro):评估设置改为 8 次重复、max_tokens=120000,MMLU-Pro 说明为 greedy 单次;GPQA 默认提示词 eval/aai/mcq-4choices,AIME 默认 generic/math;三个基准分别迁移为 sgl-eval run gpqa / aime25 / mmlu_pro
    - Kimi-K2.6.mdx(AIME 2025):32 个随机种子的 for 循环迁移为 --n-repeats 32max_concurrent_requests=512 映射 --num-threads 512,prompt 显式指定 --prompt matharena-aime
  3. 参数映射逻辑:seeds 对应 --n-repeatstokens_to_generate 对应 --max-tokens,temperature 与 top_p 直接映射;MiniMax 页移除 parse_reasoning=True,因为 sgl-eval 对默认基准已内置解析。
  4. 提交演进:第一笔提交完成主体替换(cookbook: ns eval -> sgl-eval),第二笔提交补齐 MiniMax 页最后一个遗漏的 MMLU-Pro 代码块(cookbook: last ns block -> sgl-eval mmlu_pro)。
  5. 配套改动:无源码、测试、配置或 CI 联动;唯一外部动作是 Mintlify 自动触发文档预览构建。
文件 模块 状态 重要度
docs/cookbook/autoregressive/MiniMax/MiniMax-M2.7.mdx 文档 modified 4.05
docs/cookbook/autoregressive/Moonshotai/Kimi-K2.6.mdx 文档 modified 3.98
docs/cookbook/autoregressive/DeepSeek/DeepSeek-V3_2.mdx 文档 modified 3.35

关键源码片段

docs/cookbook/autoregressive/MiniMax/MiniMax-M2.7.mdx documentation

改动量最大的文件(+26/-45),GPQA、AIME 2025、MMLU-Pro 三个基准的复现命令全部从 ns eval 迁移至 sgl-eval run,并更新评估设置说明(8 次重复、MMLU-Pro 贪婪单次)。

# 先安装 sgl-eval,数据集、提示词与 grader 随仓库分发,保证与文档数字一致
pip install git+https://github.com/sgl-project/sgl-eval.git
​
# --n-repeats 8 对应原 NeMo-Skills 的 8 个随机种子,GPQA 使用 4 选 1 的默认提示词
sgl-eval run gpqa \
    --base-url http://localhost:30000/v1 \
    --model MiniMaxAI/MiniMax-M2.7 \
    --n-repeats 8 \
    --max-tokens 120000 \
    --temperature 0.6 \
    --top-p 0.95
docs/cookbook/autoregressive/Moonshotai/Kimi-K2.6.mdx documentation

AIME 2025 复现从 32 seed for 循环改写为 sgl-eval 单命令,涉及 --n-repeats 32、--prompt matharena-aime、--num-threads 512 等关键参数映射。

# 原流程用 for 循环准备 32 个随机种子,这里用 --n-repeats 32 一次完成
# --prompt matharena-aime 对应原配置 eval/matharena/aime
sgl-eval run aime25 \
    --base-url http://localhost:30000/v1 \
    --model moonshotai/Kimi-K2.6 \
    --n-repeats 32 \
    --temperature 1.0 \
    --top-p 0.95 \
    --max-tokens 131072 \
    --prompt matharena-aime \
    --num-threads 512

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

  • 参数对应风险:--n-repeats 与原 seeds 的逐位对齐语义(随机种子固定方式)未在文档中展开;--prompt matharena-aime 与库内 prompt 名称的对应关系仅由 sgl-eval 仓库保证,名称变更会直接导致命令失效。
  • 版本耦合风险:文档统一使用 pip install git+https://github.com/sgl-project/sgl-eval.git,未锁定版本,CLI 参数演进后旧命令可能失配。
  • 复现验证风险:文档宣称可复现数字,但页面内未给出 sgl-eval 版本号或校验步骤,工具行为变化时不方便核对。
  • 影响范围:仅三份 .mdx 文档与文档预览构建,无运行时、性能或安全风险。
  • 用户影响:按 cookbook 复现精度数字的读者从 NeMo-Skills 切换到 sgl-eval,命令更短、依赖更少,但仍需自行安装 Python 包并核对 CLI 参数。
  • 团队影响:三个模型页面的 benchmark 数字披露统一由 sgl-eval 承载,后续新增模型页可直接复用 sgl-eval run 模板。
  • 影响程度:低,纯文档变更,不改动任何运行时逻辑。
参数映射需核对 sgl-eval 未锁版本 纯文档无自动化校验

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论