修复 XPU attention page_size > 1 时 KV 缓存页表错误
值得精读以理解 page table 粒度转换的重要性,以及局部 attention 的正确前提。关注 reviewer 提出的代码复用建议,可作为后续重构候选。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 XPU attention page_size > 1 时 KV 缓存页表错误
值得精读以理解 page table 粒度转换的重要性,以及局部 attention 的正确前提。关注 reviewer 提出的代码复用建议,可作为后续重构候选。
新增贡献者 CI 权限配置
可通过,无技术风险。
复用 origin_input_ids 避免重复内存分配
该 PR 属于代码整洁性改进,逻辑简单,风险低,适合快速合入。对于关注性能细节的读者,可借此了解常见请求路径下的小型内存优化手法。
添加 PD 测试与调度器异常快速终止机制
值得精读。PR 展示了如何在分布式系统中设计安全、可选的中断机制,其 opt-in 设计、测试夹具的 teardown 顺序、环境变量命名规范都可作为内部可靠性改进的参考模板。
修复 DP Attention 空闲批次 stale metadata 引发的 UAF
这是一个高价值、低风险的关键 bugfix,建议快速合入。根因分析详实,可作为调试复杂并发 bug 的范例。
添加可配置 DSA topk 后端,支持 torch/flashinfer
值得精读,尤其是 `DSATopKBackend` 的模块化设计模式,可为类似多后端场景提供参考。测试代码的等价性验证策略也有借鉴意义。
重构 HiCache 堆栈分发为策略模式
原始 PR · 作者 ShangmingCai · 合并时间 2026-05-25 23:52
将 EPD CI 测试移至 base-c stage
参与讨论