Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58

PR 列表

更多筛选
2026-08-28
性能优化 重要性 6.75 洞察度 6.00

支持 SANA-Video 转置残差门控,内核提速 2.3 倍

值得精读。该 PR 展示了一种在 CUDA kernel 内部消化非标准张量布局、避免数据搬运的典型技巧,适合作为 diffusion 内核优化的参考案例。关注 `_is_transposed_dense_residual` 的守卫设计、共享内存 tile 的 padding 策略,以及 `torch.empty_strided` 在 CUDA Graph 场景下的用法。

功能 重要性 7.58 洞察度 6.00

为排队请求重试 L3 存储预取,提升高并发下命中率

值得 HiCache、调度与缓存生命周期相关工程师精读:miss 标记一次性消费、按调度 pass 而非墙钟节奏重试、anchor 提前 pin 与 cap clamp 三个设计点有借鉴价值。由于缺少公开性能复现且功能默认关闭,生产启用前建议基于自身负载 benchmark 并监控调度延迟。

缺陷修复 重要性 6.13 洞察度 5.00

修复混合预取丢弃后存在缓存未愈合的问题

该 PR 值得精读,因为它解决了一个特定的缓存一致性 bug,展示了如何通过局部失效来保持缓存正确性。设计上通过计算 `keep_pages` 精确控制失效范围,避免过度失效,体现了对性能的考量。建议关注其计算逻辑的边界条件,并考虑补充单元测试以覆盖该路径。

缺陷修复 重要性 4.28 洞察度 6.00

修复 MoE LoRA align 内核在 ROCm 上的编译失败

建议精读的重点: - 学习如何在 JIT 内核中做平台适配,尤其是 hipify 缺失时的处理方法。 - 理解依赖闭包与缓存失效的关系,避免滥用公共头文件。 - 参考测试注册模式,为平台相关内核补充对应 CI。

缺陷修复 重要性 5.83 洞察度 5.00

修复 Qwen3.5 AMD 融合路径空批量守卫元组崩溃

值得精读。该 PR 是一个典型的数据契约变更(函数返回值从张量变为元组)引起的下游兼容修复,展示了如何通过最小改动适配上游变化。对于涉及此类融合 kernel 的开发,有参考价值。

测试 重要性 3.99 洞察度 3.00

限制 ROCm 上 HiCache MGSM 评估并发

值得快速浏览,作为针对特定硬件环境的测试参数调整示例。关注点:使用条件属性覆盖默认值,保持非 HIP 行为不变,最小化改动。无需深入精读。

文档 重要性 5.63 洞察度 4.00

校准 Hy4-Preview 部署配方,修正参数与后端配置

值得快速精读的文档-运行时一致性案例。两个设计决策尤其值得借鉴:用运行时行为约束 UI 可选项(删除 EP 旋钮),以及用真实硬件验证驱动徽章状态而非凭估算标注。仓库维护者可复用该模式审计其他模型 cookbook,尤其是带 DeepEP、EP 参数和 reasoning_effort 示例的页面。

参与讨论