融合 DSA 元数据生成,CUDA graph replay 减负 70%
值得精读。展示了如何用 Triton 内核融合多个小操作以减少 kernel launch 开销,`do_not_specialize` 的使用是避免重编译的关键技巧。此外,review 中关于 try-except 与 if-else 的取舍、拆分依赖的实践,都有参考价值。
SGLang is a high-performance serving framework for large language models and multimodal models.
融合 DSA 元数据生成,CUDA graph replay 减负 70%
值得精读。展示了如何用 Triton 内核融合多个小操作以减少 kernel launch 开销,`do_not_specialize` 的使用是避免重编译的关键技巧。此外,review 中关于 try-except 与 if-else 的取舍、拆分依赖的实践,都有参考价值。
图像预热默认使用模型分辨率,声明Z-Image默认1024x1024
本PR设计清晰,改动量小但成效明显,值得阅读 `_resolve_default_warmup_resolution` 的新逻辑和 `ZImageTurboSamplingParams` 的配置声明。对于团队,建议在新模型配置中统一声明 `width`/`height`,使预热自动受益。
迁移JIT测试CI注册到stage/runner_config模型
本PR值得CI维护者精读,特别是run_suite.py中的命名约定和skills文档的示例。设计决策上,将suite拆分为stage和runner_config提高了灵活性,但命名中嵌入硬件规格(如1-gpu-large、4-gpu-b200)可能造成耦合,后续可考虑进一步抽象。
原始 PR · 作者 JackChuang · 合并时间 2026-06-30 09:00
新增 SM90 Q8KV8 FP8 稀疏 MLA 预填充 JIT 内核,性能提升 1.15-1.31x
此 PR 是高质量的独立内核提交,代码结构、测试覆盖和性能数据完善。推荐所有关注 Hopper FP8 优化和注意力机制的工程师精读,特别是 Python 封装和编译标志裁剪部分值得借鉴。
原始 PR · 作者 JackChuang · 合并时间 2026-06-30 07:51
融合 SiLU+Mul 与 NVFP4 量化到单个 CUDA 核,消除中间缓冲
该 PR 值得精读,尤其是 CUDA kernel 融合策略、JIT kernel 注册流程以及 MoE 后端选择逻辑。设计上在保持精度 bit 一致的同时获得性能收益,是典型的高阶优化。
原始 PR · 作者 AliceChenyy · 合并时间 2026-06-30 07:27
集成 FlashInfer SM120 稀疏 MLA 解码,decode 提升 2.2-3.7x
值得精读,尤其关注 `_page_split_kernel` 的 fused layout 转换设计和 FlashInfer 集成的惰性缓冲区策略。设计决策中,索引重映射恒等移除和直接导入 FlashInfer(而非自动检测)是重要权衡。
支持 Flashinfer A2A 与 TRTLLM 路由 MoE 融合
值得精读,特别是 fused func 的注册模式、dummy token 移除的假设和 FP4 量化前处理的优化。设计上通过 `@register_fused_func` 保持了 dispatcher 和 runner 的解耦,该模式可推广到其他 MoE 后端组合。
修复 DeepSeek V3 双流 MoE 中 CUDA 图捕获顺序导致的精度崩溃
- **值得精读**:本 PR 揭示了 CUDA 图捕获中一个极其微妙且危险的陷阱——host-side 张量元数据修改与 CUDA 图捕获的交互问题。 - **值得学习的设计权衡**:为性能收益(~1%),作者选择了“按顺序即正确”的方案而非更健壮的修复,但记录了明确的注释和未来改进方向。 - **测试覆盖**:虽然无直接新增的单元测试,但通过 `test_moe_ep_extra.py` 的 gsm8k 测试(精度 > 0.60)验证了正确性。
参与讨论