Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-07-07

#30278 Fix LTX2 RoPE JIT kernel CI

原始 PR · 作者 b8zhong · 合并时间 2026-07-07 10:15

缺陷修复 重要性 3.84 洞察度 3.00

修复 LTX2 RoPE JIT 内核测试精度问题

该 PR 属于小型修复,对于关注 CI 稳定性和精度模型的开发者有一定参考价值。值得注意的决策是使用 `F.rms_norm` 在 fp32 域直接计算,避免了 `nn.RMSNorm` 在 `autocast` 下的隐式类型转换,这是一种通用的测试精度修复模式。

#27867 [DSv4] Loading Time Weight Dequant

原始 PR · 作者 laixinn · 合并时间 2026-07-07 09:54

功能 重要性 7.63 洞察度 6.00

DSV4 Flash 加载时 FP4→FP8 去量化,TP8 性能提升 1.56-2.23x

值得精读,尤其是 `cast_e2m1fn_to_e4m3fn` 的无损转换设计和 review 中关于环境变量检测的讨论。若需在 H20 上部署 DeepSeek V4 Flash 并利用 TP=8,此 PR 是关键依赖。

功能 重要性 8.45 洞察度 6.00

为预填充阶段引入全 CUDA 图后端

值得精读源代码,尤其是 `flashinfer_backend.py` 中的 workspace 计算和 `prefill_cuda_graph_runner.py` 中 slot 管理逻辑,展示了在变长输入下 CUDA 图捕获的经典填充策略。对于关心推理引擎极致性能的工程师,这是重要的参考实现。

性能优化 重要性 6.25 洞察度 5.00

XPU 跳过单专家 MoE 无意义归约

此 PR 值得阅读,特别是对于理解如何针对特定硬件(XPU)进行 MoE 内核启动优化的开发者。设计决策中体现了维持后端一致性和优化成本的平衡——作者选择与 CUDA 路径保持一致而非提前分配 `intermediate_cache3` 的激进优化,避免了过度定制化风险。同时,测试覆盖完整,可作为小型性能优化的范例。

缺陷修复 重要性 6.83 洞察度 3.00

修复 rollout 响应中 img_shapes 逐样本切片错误

值得合并,修复了明确的功能回归 bug。改动简单、安全,已获得批准。建议合并后补充一个针对 `_extract_single_sample_tensor` 的单元测试,覆盖 `img_shapes` 的 batch_size > 1 场景,以预防未来回归。

重构 重要性 8.56 洞察度 7.00

重构 CPU norm 内核为 trait 框架,新增 fused_qk_gemma_norm

值得精读。本 PR 展示了 C++ 模板元编程在 SIMD 内核库中的典型应用,利用 NormTraits 和 NormReduce 实现零开销抽象。对于计划在 sgl-kernel 中添加新 norm 变体的开发者,框架设计模式有直接参考价值,建议重点阅读 NormParams 和 NormReduce 的实现。

参与讨论