Prhub

sgl-project/sglang · 标签视图

标签列表

聚合结果

moe 相关 PR

2026-09-01
功能 重要性 8.50 洞察度 7.00

SM90 新增 MXFP4 W4A8 MoE 路径,kernel 吞吐提升约 2 倍

值得精读。重点学习三点:1) 在全局 pin 旧版 FlashInfer 时如何以 opt-in 方式安全接入新内核并即时失败提示;2) 用 `preserve_expert_range` + `last_real` / `k_real` 处理对齐 padding 与预取整尾列,保证 Humming residual 数值稳定;3) 对上游 ABI(routed-row vs per-local-expert)变更的取舍与版本门控设计。

性能优化 重要性 8.36 洞察度 8.00

SM10X Command-A-Plus 解码提速 2.3 倍,BCG 捕获内存降 78%

值得精读。三项改动都落在核心路径且跨模块(模型实现 + 配置门控 + 白名单 + 测试),评分 7。重点学习:流的按角色租用如何规避缓存分配器分池导致的捕获 OOM;多流并行时 in-place 别名引发的跨流数据竞争及其消除方法;decode-only 重叠的收益边界(prefill 已饱和时事件开销大于收益);fail-closed 门控如何在不确定配置下避免把用户带进崩溃路径,并用"不可读配置"测试用例固化契约。

性能优化 重要性 5.56 洞察度 5.00

放宽 FLA/MoE 共享内核 shape 上限,grid 拆分避免超限

值得精读,尤其适合 kernel 开发者与多模态/新模型 day0 支持方向的工程师。三个值得借鉴的设计决策:一是把「易超限的折叠轴拆到独立 grid 轴」作为通用模式,可平移到其他 Triton kernel;二是从 `stride(0)` 而不是 `shape[1]` 推导 per-request 缓存步数,以适配 adaptive speculative decoding 下运行时形状变化,这是一个容易被忽略的正确性细节;三是多 block-per-row 拆分隐藏维度的做法,解除了 `out_dim <= 1024 * kVecSize` 的隐性限制。合入前建议确认 CI 失败原因,并在 main 分支补齐新模型大 shape 场景的显式验证。

功能 重要性 7.96 洞察度 6.00

FlashInfer CuTe DSL 新增 NVFP4 W4A16 模式,激活保持 BF16

值得精读,尤其关注以下设计决策:`quant_mode` 作为贯穿 dense/MoE/dispatcher/模型守卫的统一决议值如何避免分叉;`copy_or_rebind_param` 在 CUDA graph 与 disk reload 场景下保持 tensor 绑定的手法;W4A16 下对 FlashInfer A2A 强制 BF16 dispatch 而非引入第二套 workspace 的取舍。本 PR 的测试组织(online 精度 + reload 确定性 + lm head 守卫)也值得作为量化后端集成的参考样例。

#37279 Bump sgl-deep-gemm to 0.1.7

原始 PR · 作者 Fridge003 · 合并时间 2026-09-01 08:16

功能 重要性 8.44 洞察度 6.00

升级 sgl-deep-gemm 至 0.1.7,MegaMoE 改用 mma_type API 支持 MXFP4

值得精读,尤其是两个设计点:一是对称 buffer 缓存 key 纳入 mma_type 的隔离思路,避免了跨类型 buffer 串用的隐性 bug;二是 _interleave_mega_moe_gate_up 同时支持 gran=8 连续交错与 gran=16 even/odd 交错两种布局,展示了如何在同一函数内兼容不同上游内核的权重排布。对依赖升级类 PR,这种“版本钉版 + 调用点迁移 + 行为回归测试”的配套做法也值得借鉴。

2026-08-31
性能优化 重要性 5.16 洞察度 4.00

GB300 GLM-4.5 FP8 新增 Triton MoE 配置,吞吐提升约 22%

值得性能工程师精读。它展示了 SGLang Triton MoE 配置系统的设计要点:通过文件名编码 device、Triton 版本、dtype、量化模式与形状选择器,配置与代码解耦。同时也呈现了完整的调优验证流程:microbenchmark 定位、端到端服务压测、精度对比与 CUDA Graph 捕获验证。需要注意该 PR 最终没有携带自动化测试,建议关注合入后该 lane 是否会被后续重构影响。

测试 重要性 4.01 洞察度 4.00

恢复 Blackwell NVFP4 MoE 两项 GSM8K 精度测试

值得快速浏览,尤其适合关注跨仓库依赖治理与测试恢复流程的读者。设计要点:① 严格区分「测试启用」与「依赖升级」职责,本 PR 刻意不碰包版本,将改动面压到最小;② 用完整 GSM8K 复测 + 明确环境快照(镜像、硬件、包版本、日志哈希)作为恢复测试的证据链,而非仅依赖上游声明修复;③ 保留原始阈值和工作负载不做放宽,确保召回质量不打折。

缺陷修复 重要性 7.55 洞察度 6.00

修复 GLM MoE 路由过期:门控权重改存 FP32

值得精读。核心价值在于“消除重复状态”的设计决策:与其为 BF16 参数维护 FP32 影子缓存并不断补刷新钩子(weight_loader + post_direct_write),不如让单一 FP32 参数成为唯一事实来源,类型转换统一交给加载器。这一取舍对任何需要支持运行时权重热更新的模型实现都有借鉴意义;同时值得关注 WeightChecker 过滤契约的收紧会给 RL 链路带来的行为变化。