Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 03:32 同步状态:空闲 下次计划:2026-09-05 04:32

PR 列表

更多筛选
2026-04-01
功能 重要性 5.00 洞察度 5.00

为diffusion服务器添加uvicorn访问日志前缀排除功能,减少噪声日志。

该PR值得快速浏览,关注日志过滤器的实现细节(如`_UvicornAccessLogFilter`类中从`record.args`提取路径的方法),但无需深入分析,因变更较小且直白。

#21709 Fix draft extend cuda graph when spec_step=1

原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-04-01 09:29

缺陷修复 重要性 4.00 洞察度 3.00

修复spec_step=1时CUDA图支持判断错误,确保草稿扩展使用正确后端。

该PR值得精读,展示了草稿扩展中后端选择与CUDA图支持的耦合关系。关注点:1. draft_attn_backend与draft_extend_attn_backend的职责分离;2. HIP代码块未修复的潜在问题;3. 后端类名重构的上下文。

基础设施 重要性 4.00 洞察度 3.00

添加测试网络超时和动态并行度配置以优化 CI 稳定性。

对于技术管理者和工程师,此 PR 值得关注以了解 CI 基础设施的优化模式,特别是超时设置和并行度配置;对于核心开发者,无需深究代码细节,但可借鉴类似维护实践。

缺陷修复 重要性 3.00 洞察度 2.00

修复gRPC服务器导入错误链,避免真实异常被屏蔽,提升调试体验。

该PR变更简单直接,适合快速review;对于理解Python异常链和错误处理最佳实践有参考价值,值得关注错误消息设计的清晰性。

#21314 CUTLASS NVFP4 GEMM improvement of SM120

原始 PR · 作者 b8zhong · 合并时间 2026-04-01 09:04

性能优化 重要性 7.00 洞察度 7.00

重构NVFP4 GEMM内核以优化SM120性能,新增CUTLASS后端选项。

此PR值得精读,尤其对于参与量化或内核开发的工程师。建议关注: 1. SM120内核设计中的tile size选择和配置结构(如 `sm120_fp4_config_small_m`),以学习架构特定优化方法。 2. workspace分配从CUDA切换到PyTorch的决策过程,了解多流安全性的考量。 3. 新后端集成模式,作为未来添加其他后端(如cuDNN)的参考模板。

性能优化 重要性 7.00 洞察度 7.00

优化 fused_qknorm_rope JIT 内核,通过减少冗余计算和降低寄存器压力提升性能。

建议工程师精读 `fused_qknorm_rope.cuh` 中的内核优化逻辑,特别是循环重构和模板参数设计,关注寄存器优化技巧和编译时分支消除,这些对 CUDA 内核性能调优有借鉴价值。同时,可参考基准测试扩展方法以验证实际工作负载性能。

#21528 Remove obsolete sgl-kernel legacy paths

原始 PR · 作者 BBuf · 合并时间 2026-04-01 09:00

重构 重要性 4.00 洞察度 2.00

移除 sgl-kernel 中的过时遗留路径和内核,清理代码库。

该 PR 值得快速浏览以了解代码清理方向,但无需精读细节。对于关注内核演进或 sgl-kernel 模块的工程师,可注意移除的设计决策(如 AOT 到 JIT 的迁移)和过时功能的淘汰趋势。

缺陷修复 重要性 4.00 洞察度 3.00

修复 killall.py 在 sglang 未安装时的导入崩溃问题,确保 CI 稳定。

该 PR 变更简单直接,不值得精读,除非关注 CI 脚本细节或 import 依赖管理。可关注内联外部命令调用的模式,以避免模块导入依赖。

参与讨论