Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 05:40 同步状态:空闲 下次计划:2026-09-05 06:40

PR 列表

更多筛选
2026-05-28
缺陷修复 重要性 7.20 洞察度 7.00

修复RMSNorm残差路径忽略cast_x_before_out_mul标志

这是一个高质量 bugfix,修复了影响核心正确性的问题,且设计迭代清晰——从临时 fallback 到独立 kernel 再到合并到现有 kernel。值得精读:展示了如何在 CUDA kernel 中通过 `if constexpr` 实现多语义路径,以及如何平衡数值精度与性能。建议相关模型维护者关注黄金测试是否需要调整。

缺陷修复 重要性 7.35 洞察度 6.00

修复 FlashInfer SWA EXTEND-with-prefix 的正确性

建议精读。该 PR 精准定位并修复了一个在 SWA + 前缀缓存组合场景下的静默错误,涉及 FlashInfer 滑动窗口注意力的内部协作细节,对理解 FlashInfer 后端的多 wrapper merge_state 路径有较高参考价值。

缺陷修复 重要性 7.23 洞察度 6.00

为 TorchNativeAttnBackend 添加滑动窗口掩码支持

该 PR 修复了一个影响正确性的 bug,实现清晰且改动范围小,值得合并。建议关注后续的测试 PR,以确保滑动窗口掩码逻辑在各种情况下(如 prefix caching、PD 分离等)的正确性。

缺陷修复 重要性 5.94 洞察度 4.00

修复 ERNIE-4.5 在 NPU 上的 correction_bias 维度错误

该 PR 以最小改动修复了 NPU 上的阻塞问题,值得快速合并。但建议后续将 NPU 特定逻辑收敛到公共组件(如 TopK 层或 NPU 后端),避免模型定义中重复硬件判断。RoPE 风格的修复为重要安全措施,已通过 review 确认。

缺陷修复 重要性 5.70 洞察度 4.00

修复FlexAttention掩码方法因绑定self导致跟踪崩溃

值得合入,属于低风险高质量修复。建议读者关注 `@staticmethod` 在避免意外闭包捕获方面的设计模式。

#26512 Fix FA DRAFT_EXTEND_V2 cache extent

原始 PR · 作者 ch-wan · 合并时间 2026-05-28 15:56

缺陷修复 重要性 6.77 洞察度 6.00

修复 FlashAttention DRAFT_EXTEND_V2 缓存范围错误

值得精读。该 PR 展示了注意力后端中缓存范围元数据的精细语义差异,特别是 DRAFT_EXTEND_V2 中 seq_lens 与有效缓存长度不一致时的正确处理方式。设计决策如 per-request 求和取最大值而非简单双 max 求和,体现了对偏斜分布的考量,值得在其他注意力后端实现中参考。

参与讨论