修复 token id 越界导致的 GPU crash
值得合并:修复了实际 CI 干扰的 flaky bug,且通过添加防御性断言改善了调试体验。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 token id 越界导致的 GPU crash
值得合并:修复了实际 CI 干扰的 flaky bug,且通过添加防御性断言改善了调试体验。
修复 async probe 对 None 张量的崩溃
建议合并。修复直击根因,代码简洁,有 CI 验证。可关注后续是否需为其他类似场景添加 `None` 守卫。
原始 PR · 作者 DevashishLal-CB · 合并时间 2026-06-07 12:48
允许 OOT 平台提供自定义量化配置
值得精读,特别是作为硬件抽象层扩展点的设计范例。建议关注后续是否引入测试以及是否在真实 OOT 平台中使用。设计决策(返回 `None` vs 抛异常)可以在团队内推广。
原始 PR · 作者 huangtingwei9988 · 合并时间 2026-06-07 12:46
Mooncake 存储支持 layer-first 多缓冲布局
值得精读,特别是关注 HiSparse 和未来 PD 传输的开发者。展示了如何通过少量代码扩展存储后端以支持新布局,体现了良好的扩展性设计。
修复 Req token-id array 拼接错误
值得精读。特别是讨论中关于类型归一化策略的权衡(在 Req 内部转换 vs 调用者转换),以及 array 在序列操作中的性能优势。此外,`custom_logit_processor` 的优化展示了如何避免不必要的数据复制。
在 KV 写入路径添加越界探测
值得合并。这是一个低风险、高 ROI 的调试增强,在 spec 测试中已证明有效。建议在更广泛的 CI 中逐步启用 `SGLANG_ENABLE_ASYNC_ASSERT`,以最大化收益。
修复 SWA 准入预算少算 HiCache load-back 消耗
建议精读此 PR,尤其是 _swa_budget_for_req 的预算逻辑和 MatchResult 拆分的设计。layering violation 可作为后续重构的引导。
原始 PR · 作者 alphabetc1 · 合并时间 2026-06-07 10:46
提取 Mamba 插槽分配器到 allocator/ 子包
值得精读。展示了如何将内联分配逻辑提取为独立组件,以及重构中的设计选择(不继承 KV 分配器基类)。对于理解 SGLang 内存管理架构有帮助。
参与讨论