Prhub

sgl-project/sglang · 标签视图

标签列表

聚合结果

benchmark 相关 PR

2026-09-01

#37201 Fix Mooncake serving benchmark trace rows

原始 PR · 作者 alphabetc1 · 合并时间 2026-09-01 02:43

缺陷修复 重要性 5.81 洞察度 3.00

修复 Mooncake benchmark 字典行下访问 prompt 崩溃

值得简单浏览:原因在于它展示了如何在 benchmark 入口区分‘数据格式未转换’与‘已转换的强类型对象’,以及如何避免在公共入口中堆积数据集特判。Mooncake 相关逻辑仍集中在 `serving.py`,未来可考虑将 trace 行的转换提前到数据加载阶段,从根上消除这类分支。

2026-08-30
重构 重要性 7.72 洞察度 4.00

gpqa/aime25 评测统一到 sgl-eval,删除 1800+ 行死代码

值得精读 run_eval.py 的改动:_run_sgl_eval 中 reasoning_effort/seed/repeat 的透传方式,是评测框架迁移时最容易踩的坑,本 PR 给出了正确处理;三 sigma 基线重测方法论与 CLI 参数清理清单也可直接复用。整体属于评测基础设施清理,不涉及推理核心路径,适合作为「评测统一化」类 PR 的参考模板。

性能优化 重要性 8.61 洞察度 8.00

重调 W4AFP8 requant 启动几何,decode 内核提速最高 12x

值得精读。三个设计决策有普适价值:1) tile 大小以 bytes-per-lane 而非元素数定义,天然兼容 wave32/wave64 厂商差异;2) 行估计必须向下取整到 2 的幂,与 dispatch_a 的上取整形成互补而不是叠加(否则每个 2 的幂边界 m-grid 翻倍);3) 两阶段行调度(per-expert strided + 全局溢出共享)解决“平均值掩盖峰值”的经典调度问题,并用 row_cap slack 2x 在均匀负载代价(13-20%)与偏斜回归之间取平衡。阅读时建议对照 PR body 的性能表和提交历史中的 “share overflow rows”、“tile per lane” 两个关键演进提交。

2026-08-29
文档 重要性 4.08 洞察度 4.00

三份 cookbook 精度复现命令迁至 sgl-eval run

建议快速浏览:如需通过 sgl-eval 复现模型精度数字,本 PR 是标准示例,重点看三个页面的参数映射(seeds 到 --n-repeats、tokens_to_generate 到 --max-tokens、并发数到 --num-threads)与默认 prompt 处理;无需精读,不涉及架构或性能决策。

性能优化 重要性 7.03 洞察度 6.00

SM90 大 FP8 GEMM 路由到 Torch,显著提速但引发小形状回归

值得精读,尤其是 `Fp8ScaledMMOp` 的 `BaseFusedOp` 多后端注册与 `_prefer_torch_rowwise_fp8` 的资格检查模式,是未来内核选择机制的参考范本。但需注意启发式阈值必须经过广泛形状扫描验证,且应建立自动化的跨形状性能回归测试,防止此类硬编码规则再次引发性能回退。

2026-08-28

#36827 [Docs] Add GLM-5.3 cookbook

原始 PR · 作者 Fridge003 · 合并时间 2026-08-28 22:56

文档 重要性 7.59 洞察度 4.00

新增 GLM-5.3 部署 cookbook,含多硬件实测数据

值得精读。虽然是文档变更,但它的数据治理方式很有参考价值:如何用 match 元组把 benchmark 与部署单元格绑定、如何用 verified/experimental/pending 表达数据可信度、如何用环境变量说明隔离“机制验证”与“正确性”数据。对部署工程师,建议直接使用 cookbook 中的 FP8 配方,但注意版本绑定与 NVFP4 的 Experimental 标注;对文档维护者,建议先同步 PR body 与内容的差异,并考虑为旧 benchmark 数据增加“于某版本失效”的提示。

性能优化 重要性 6.70 洞察度 6.00

4D scale-shift 去请求时 autotuning,冷启动提速 21%

值得精读的 kernel 性能优化案例。核心价值在于“对带宽受限、每步调用的内核,请求期 autotune 成本超过收益”这一判断方法,以及配套的 ABBA 冷启动对比、输出哈希一致性、CI benchmark 三位一体的验证方式。建议后续在同类小内核(如 elementwise、逐 token 归一化)中复用该模式,并保持“小内核静态化 + 大内核 autotune”的分类原则。

documentation 重要性 5.96 洞察度 4.00

GLM-5.3-Flash cookbook 恢复 HiCache、新增 DCP4、重测基准

值得精读:对维护部署 cookbook 的工程师有参考价值,尤其是“文档配置面板与运行时修复联动”“基准数据治理”两个点。关注点:DCP4 两条基准行的 match 键(kvDsaPair + dcp 组合)与配置面板维度的互斥关系,以及 HiCache 重新启用后与 Low Latency 策略的隐藏依赖。精读强度中等。