Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-04 01:42 同步状态:空闲 下次计划:2026-09-04 02:42

PR 列表

更多筛选
2026-06-10

#27671 Defer DeepGEMM PDL setup to worker init

原始 PR · 作者 merrymercy · 合并时间 2026-06-10 04:52

缺陷修复 重要性 5.64 洞察度 4.00

延迟 DeepGEMM PDL 初始化到 worker 阶段

该 PR 规模小、逻辑清晰,适合快速合并。值得一提的是,它体现了多进程 GPU 编程中一个重要的最佳实践:避免在 fork 之前进行 CUDA 上下文初始化。团队可以参考此模式,检查其他可能在模块导入时初始化 CUDA 的代码。

基础设施 重要性 6.12 洞察度 4.00

移动 JIT 内核测试并添加包内注册保护

该 PR 是一项重要的 CI 基础设施改进,建议所有涉及 JIT 内核开发的成员仔细阅读。特别是预提交钩子的设计(复用 `ut_parse_one_file` 确保检测逻辑一致性)值得在其他项目借鉴。建议在合并后监测一段时间的 CI 运行,确保搬迁后的测试都能正确执行。

缺陷修复 重要性 5.76 洞察度 5.00

修复 ROCm 上 4D per-frame shift 形状处理

该 PR 值得 CI 维护者和 AMD 平台开发者精读。核心价值在于:1) 展示了如何通过平台条件编译修复跨后端差异;2) 揭示了 Triton kernel 在形状假设上的潜在陷阱;3) 提供了清晰的 root cause 分析和测试验证方法。

2026-06-09
性能优化 重要性 8.74 洞察度 7.00

LTX-2 VAE 解码内存布局优化,Conv3d 加速 ~3.7 倍

值得精读,展示了内存布局优化驱动性能提升的完整实践:从问题定位(conv3d-bound)、设计权衡(自定义 kernel vs 简单 copy_)、自门控实现到加载器精细控制。`_causal_temporal_pad_channels_last` 的 allocate+copy_ 设计是亮点,可复用至其他时序卷积优化。

功能 重要性 9.00 洞察度 7.00

sgl-router 新增请求/TTFT/Worker 指标与 Grafana 仪表盘

建议精读该 PR,尤其是 Histogram 泛化、断路器快照和 SSE 首字节钩子的设计。三个设计模式(RAII 守卫、单锁快照、take-only-once 钩子)具有通用借鉴价值。

#27506 Add more testing for chunked prefill

原始 PR · 作者 fzyzcjy · 合并时间 2026-06-09 20:19

测试 重要性 7.97 洞察度 6.00

为chunked prefill添加系统性脚本化测试套件

建议调度器维护者精读`test/registered/chunked_prefill/`中的脚本化测试,理解框架的断言模式;对于其他模块开发者,scripted-runtime框架可以推广到其他子系统的细粒度测试。该PR的测试设计(精确步进+状态断言)值得作为项目测试标准。

参与讨论