Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 00:08 同步状态:空闲 下次计划:2026-09-03 01:08

PR 列表

更多筛选
2026-06-30
性能优化 重要性 8.55 洞察度 6.00

融合 DSA 元数据生成,CUDA graph replay 减负 70%

值得精读。展示了如何用 Triton 内核融合多个小操作以减少 kernel launch 开销,`do_not_specialize` 的使用是避免重编译的关键技巧。此外,review 中关于 try-except 与 if-else 的取舍、拆分依赖的实践,都有参考价值。

性能优化 重要性 6.62 洞察度 5.00

图像预热默认使用模型分辨率,声明Z-Image默认1024x1024

本PR设计清晰,改动量小但成效明显,值得阅读 `_resolve_default_warmup_resolution` 的新逻辑和 `ZImageTurboSamplingParams` 的配置声明。对于团队,建议在新模型配置中统一声明 `width`/`height`,使预热自动受益。

重构 重要性 4.44 洞察度 4.00

迁移JIT测试CI注册到stage/runner_config模型

本PR值得CI维护者精读,特别是run_suite.py中的命名约定和skills文档的示例。设计决策上,将suite拆分为stage和runner_config提高了灵活性,但命名中嵌入硬件规格(如1-gpu-large、4-gpu-b200)可能造成耦合,后续可考虑进一步抽象。

功能 重要性 9.27 洞察度 7.00

新增 SM90 Q8KV8 FP8 稀疏 MLA 预填充 JIT 内核,性能提升 1.15-1.31x

此 PR 是高质量的独立内核提交,代码结构、测试覆盖和性能数据完善。推荐所有关注 Hopper FP8 优化和注意力机制的工程师精读,特别是 Python 封装和编译标志裁剪部分值得借鉴。

性能优化 重要性 8.58 洞察度 6.00

融合 SiLU+Mul 与 NVFP4 量化到单个 CUDA 核,消除中间缓冲

该 PR 值得精读,尤其是 CUDA kernel 融合策略、JIT kernel 注册流程以及 MoE 后端选择逻辑。设计上在保持精度 bit 一致的同时获得性能收益,是典型的高阶优化。

性能优化 重要性 7.77 洞察度 6.00

集成 FlashInfer SM120 稀疏 MLA 解码,decode 提升 2.2-3.7x

值得精读,尤其关注 `_page_split_kernel` 的 fused layout 转换设计和 FlashInfer 集成的惰性缓冲区策略。设计决策中,索引重映射恒等移除和直接导入 FlashInfer(而非自动检测)是重要权衡。

功能 重要性 7.88 洞察度 6.00

支持 Flashinfer A2A 与 TRTLLM 路由 MoE 融合

值得精读,特别是 fused func 的注册模式、dummy token 移除的假设和 FP4 量化前处理的优化。设计上通过 `@register_fused_func` 保持了 dispatcher 和 runner 的解耦,该模式可推广到其他 MoE 后端组合。

缺陷修复 重要性 7.33 洞察度 8.00

修复 DeepSeek V3 双流 MoE 中 CUDA 图捕获顺序导致的精度崩溃

- **值得精读**:本 PR 揭示了 CUDA 图捕获中一个极其微妙且危险的陷阱——host-side 张量元数据修改与 CUDA 图捕获的交互问题。 - **值得学习的设计权衡**:为性能收益(~1%),作者选择了“按顺序即正确”的方案而非更健壮的修复,但记录了明确的注释和未来改进方向。 - **测试覆盖**:虽然无直接新增的单元测试,但通过 `test_moe_ep_extra.py` 的 gsm8k 测试(精度 > 0.60)验证了正确性。

参与讨论