Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-06-16

#28085 [PD] Optimize SWA allocation

原始 PR · 作者 cctry · 合并时间 2026-06-16 02:01

重构 重要性 6.57 洞察度 4.00

优化 PD decode 场景 SWA 分配路径与内存

本 PR 属于中等重要度的重构+小优化,代码结构清晰,改动量小,推荐相关维护者精读 `swa.py` 中的分配重构逻辑,可作为同类代码清理的参考模式。

2026-06-15
重构 重要性 6.22 洞察度 4.00

移除 decode radix cache 后端白名单,仅拒绝 fake

建议合并。这是一个及时的清理性变更,消除过时限制,提升灵活性和正确性。变更简洁,测试充分,只需确认 ascend 后端确实完全支持即可。

缺陷修复 重要性 7.64 洞察度 6.00

修复 DSR1 fp8 gemm 回归:修正回退条件

建议阅读此 PR,尤其是 `fp8_utils.py` 中的回退逻辑变化和单元测试的设计。它展示了如何精细化控制 GEMM 后端选择,以及如何通过 benchmark 和测试验证性能回归修复。

缺陷修复 重要性 6.42 洞察度 5.00

修复 #25885 引入的 CUDA dual-stream overlap 性能回退

值得精读,尤其适合需要处理跨平台条件分支的开发者。PR 简洁地演示了如何修复因平台特定门控引入的回归,以及 Review 中建议的代码简化。

缺陷修复 重要性 5.38 洞察度 4.00

修复 NPU 平台 DeepSeek 模型 is_nextn 特殊处理缺失

该 PR 值得精读,尤其是对 NPU 后端和 speculative decoding 感兴趣的开发者。它是一个典型的平台特定 bugfix,展示了如何处理不同硬件后端之间的行为差异。

缺陷修复 重要性 5.99 洞察度 5.00

修复 EAGLE3 多模态 chunked-prefill crash

该 PR 是一个精准的定点 bugfix,改动量小,逻辑清晰,值得精读以理解多模态与 speculative decoding 交互时的边界情况。设计决策中值得关注的是:不对占位符 token 做硬编码过滤,而是依赖 `vocab_size` 作为通用判据——既简洁又与模型无关。

参与讨论