Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 22:27 同步状态:空闲 下次计划:2026-09-03 23:27

PR 列表

更多筛选
2026-05-25
缺陷修复 重要性 6.96 洞察度 6.00

修复 XPU 上 GDN kernel 长序列的正确性

值得精读,尤其是 `chunk_delta_h.py` 中的循环重构策略——将时间步设为外层循环有利于维护跨时间步的状态一致性,是 Triton 中复杂 kernel 的典型优化模式。review 中关于 A dtype 的讨论也值得关注,可作为后续精度增强的切入点。

性能优化 重要性 6.62 洞察度 5.00

跳过 TRTLLM MLA 中不必要的 kv-indices 计算

推荐合并。该 PR 是一个简洁、低风险的性能优化,通过消除冗余的 GPU kernel 调用实现了约 2.5% 的吞吐提升,且不影响正确性。变更加上 benchmark 数据清晰有说服力,值得精读其设计思路。

#25874 [CPU] add faster KV-cache writes

原始 PR · 作者 mingfeima · 合并时间 2026-05-25 10:28

性能优化 重要性 8.10 洞察度 5.00

CPU KV-cache 写入使用 OpenMP + AVX512 专用 kernel 加速

值得精读,尤其是 CPU 加速的通用模式:将 ATen 原生接口与 OpenMP 结合,并遵循库注册流程。可作为类似优化的参考。

功能 重要性 6.89 洞察度 5.00

调度器复用预计算的 padd 输入 ids,避免重复 padd 计算

值得精读,展示了如何通过“尝试-回退”模式在现有流程中插入预计算优化,设计简洁且侵入性低。团队成员可关注 `_try_apply_padded_mm_input_ids` 的边界条件处理及后续是否需补充测试。

#25856 Fix attr err

原始 PR · 作者 hanwlax · 合并时间 2026-05-25 10:26

缺陷修复 重要性 4.20 洞察度 2.00

修复 encoder_only 模式下的 AttributeError

此 PR 为小的 bugfix,逻辑简单且安全。如果团队使用 Qwen3VL MoE 模型的 encoder_only 模式,建议合并;否则可视为常规维护。

缺陷修复 重要性 5.90 洞察度 6.00

修复 EAGLE v2 非 CUDA Graph 路径验证元数据初始化顺序

值得精读。该 PR 虽然改动很小(两个文件共 7 行净增),但针对的是一个关键初始化和时序问题,并且清楚说明了背后设计原则:元数据必须在实际 forward 使用的 batch 形状确定之后才初始化。建议阅读时结合 `model_runner.forward_idle` 中第 3104-3108 行(PR 提及的类似模式)一起理解,可以加深对 sglang 中 CUDA Graph 和非 CUDA Graph 路径差异管理的认识。

参与讨论