Prhub

sgl-project/sglang · 标签视图

标签列表

聚合结果

fp8 相关 PR

2026-08-31

#37148 [CI] Fix stale GPU capability test patches

原始 PR · 作者 YAMY1234 · 合并时间 2026-08-31 01:12

测试 重要性 4.55 洞察度 3.00

修复 DSV4 与 FP8 测试的失效平台能力 patch,恢复 CI 保护

建议快速阅读(10 分钟内),无需精读生产代码。值得关注的设计决策:测试 patch 运行时 API 而非模块级实现细节,让测试断言真正约束生产行为;同时 PR body 对 stale patch 静默失效陷阱的说明值得团队学习。引申建议:可在 CI 或 lint 阶段增加对 `mock.patch`/`patch.object` 目标存在性的静态检查,或定期核查测试 patch 目标是否仍被生产代码引用,防止同类问题再次出现。

2026-08-28

#36827 [Docs] Add GLM-5.3 cookbook

原始 PR · 作者 Fridge003 · 合并时间 2026-08-28 22:56

文档 重要性 7.59 洞察度 4.00

新增 GLM-5.3 部署 cookbook,含多硬件实测数据

值得精读。虽然是文档变更,但它的数据治理方式很有参考价值:如何用 match 元组把 benchmark 与部署单元格绑定、如何用 verified/experimental/pending 表达数据可信度、如何用环境变量说明隔离“机制验证”与“正确性”数据。对部署工程师,建议直接使用 cookbook 中的 FP8 配方,但注意版本绑定与 NVFP4 的 Experimental 标注;对文档维护者,建议先同步 PR body 与内容的差异,并考虑为旧 benchmark 数据增加“于某版本失效”的提示。

2026-08-26
缺陷修复 重要性 6.94 洞察度 5.00

修复 FP8 委托方法读取缺失配置导致的启动崩溃

值得精读。该 bug 是两个 PR 交叉产生的典型“潜伏回归”:委托模式(#25820)与无条件属性访问(#33962)单独看都没有问题,组合后才崩溃。修复方式(用实例所有权标志叠加全局配置判断)是一个简洁且可复用的防御式设计;新增测试对“持有者/借用者/后端类型”三轴组合覆盖完整,可作为量化方法单元测试的范例。

2026-08-25
缺陷修复 重要性 7.16 洞察度 5.00

修复非 gated MoE 的 MXFP8 权重尺寸分配

值得精读。该 PR 展示了如何从层配置推导张量形状而非硬编码,是量化模块中一种可复用的模式;同时覆盖了模型结构差异导致的隐蔽 bug,具有教学意义。

2026-08-21

MI355X 上 DSV4 fp8 scale 逐层拷贝改零拷贝视图

值得精读。它展示了硬件专用性能优化如何在保持正确性的前提下安全落地:一是 zero-copy stride 重解释的布局契约设计(as_strided 交换 stride 恢复逻辑索引),二是 M>=2 发射 gate 对单 token 退化场景的处理,三是 review 中"测试必须命中真实 producer kernel 而非伪造布局"的验证方法论。对于后续在 gfx95 上扩展更多预量化站点或复用 fp8_utils helper 的工程师,本 PR 是很好的范本。

2026-08-20
缺陷修复 重要性 7.73 洞察度 5.00

修复 compressed-tensors 量化 lm_head 加载乱码问题

建议精读。该 PR 展示了一个典型的“配置语义与加载器约束冲突”问题:量化方案的 target 匹配规则由上游 `llm-compressor` 决定,而权重加载器对分片维度有硬性限制。`get_lm_head_scheme` 中对“按层名匹配 vs 模块类型匹配”的区分、以及 `matched_target` 透传的设计,在后续支持更多量化格式时值得复用。

#32440 fix(gemma4): quantize MTP bridge projections

原始 PR · 作者 ayush1399 · 合并时间 2026-08-20 03:41

缺陷修复 重要性 5.43 洞察度 4.00

修复 Gemma4 MTP 量化配置遗漏,FP8 接受率 0% 提升至 60%

值得快速精读。虽然代码改动仅 2 行,但背后是一个完整的调试故事:用 draft-token 接受率作为量化健康的观测指标,反推出 quant_config 传递遗漏。建议关注两点:一是量化配置在不同模型组件间传播时的一致性校验;二是为 pre_projection / post_projection 的量化加载补充专门的回归测试,避免同类问题复发。

2026-08-17
性能优化 重要性 5.88 洞察度 5.00

DSV4 量化内核直出 TMA 对齐 scale,decode 延迟降 1.4%

值得精读。核心设计决策是 producer-consumer 布局 co-design:让量化 kernel 直接产出消费者(DeepGEMM fp8_einsum)所需的 TMA-aligned packed 布局,省掉中间转换 kernel,这是 kernel 优化的典型思路。其次值得关注的是补零处理分配器垃圾、TensorMatcher/RuntimeCheck 对布局的严格校验,以及测试中利用 DeepGEMM 官方 layout helper 做参考、并验证 packed 与 fp32 路径 bit-exact 一致的做法。适合做算子性能优化或 GPU kernel 开发的参考样例。