Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 01:23 同步状态:空闲 下次计划:2026-09-05 02:23

PR 列表

更多筛选
2026-06-01
性能优化 重要性 7.80 洞察度 6.00

SWA LRU 窗口感知刷新,提升前缀缓存命中率

值得精读,尤其关注 `refresh_lru` 的接口设计(使用 phase 参数统一不同阶段的刷新逻辑)和窗口限制祖先刷新的实现。对于维护 SWA 或其他特殊缓存策略的开发者有参考价值。

缺陷修复 重要性 5.94 洞察度 5.00

解除DS V4 PD prefill的SWA上限

该PR改动虽小,但揭示了继承层次导致的容量管理bug,值得研读。对PD分离部署和SWA pool设计感兴趣的工程师可以重点关注。

功能 重要性 6.36 洞察度 5.00

NPU 自适应推测解码支持

建议审核并合并。该 PR 改动简洁、目的明确,已在 Ascend 910B 上进行准确性和性能测试,结果积极。无安全或兼容性顾虑。

重构 重要性 7.97 洞察度 6.00

EAGLE推测测试重构为共享Fixture+Kit

建议阅读本 PR 了解测试架构重构实践,尤其是 Fixture+Kit 模式如何提高可维护性和覆盖率表达能力。该模式值得在 SGLang 其他测试模块中推广。

性能优化 重要性 6.16 洞察度 5.00

异步图像预处理提升 EPD 编码器吞吐

建议 EPD 相关开发者阅读本 PR,了解如何通过异步化在不改变模型输出的情况下显著提升编码器性能。线程池隔离、环境变量配置、以及根据 review 缩小范围与其他 PR 分工的协作方式值得学习。

#26586 [KDA] Support KDA packed decode

原始 PR · 作者 yuan-luo · 合并时间 2026-06-01 16:52

功能 重要性 9.00 洞察度 5.00

KDA 解码融合内核避免 Python 调度开销

值得精读。设计模式(针对特定形状定制 fusion kernel 消除调度开销)可推广至其他线性注意力变体。与 GDN packed decode 的差异点(per-K 门控 vs per-head 标量)展示了如何基于已有优化框架适配不同计算模式。

参与讨论