修复 SWA 池因未预算 draft KV 导致 OOM
这是一次必要且安全的 bugfix,逻辑清晰。特别推荐给关注 SWA 与 speculative decode 内存管理的工程师精读,尤其是 `pool_configurator.py` 中 `_cell_size` 的计算方式。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 SWA 池因未预算 draft KV 导致 OOM
这是一次必要且安全的 bugfix,逻辑清晰。特别推荐给关注 SWA 与 speculative decode 内存管理的工程师精读,尤其是 `pool_configurator.py` 中 `_cell_size` 的计算方式。
原始 PR · 作者 silencejade · 合并时间 2026-06-30 15:55
NPU 上 Qwen3-VL extend 阶段路由到 fused 算子
建议审核者关注 review 评论中提到的 mrope_positions 问题,确认 forward_prepare_npu 是否已适配 Qwen3-VL 的 3D 位置编码需求。建议补充精度测试,确保精度不退化。
升级 transformers 至 5.12.1 并清理兼容层
建议精读 `mistral_utils.py` 中的 adapter 模式,它展示了如何通过 monkey-patch 平滑适配上游 API 变化而不影响核心代码。同时 `config.py` 和 `tokenizer.py` 的清理贯彻了“移除过时 workaround”的好实践。对于计划升级依赖的开发者,本 PR 提供了完整的兼容性管理案例。
AMD 平台跳过 D2H copy_stream 同步,decode 提升 12-17%
建议精读。本 PR 展示了一个值得学习的权衡案例:通用优化(copy_stream 重叠)在特定硬件上可能因同步开销导致反效果。对于类似情况,建议引入平台感知的调度条件分支。此外,该 PR 的验证手段(GSM8k + 性能 benchmark)可作为小范围性能修复的参考模板。
DSA indexer 融合直接使用 cos_sin_cache 避免缓存不同步
建议相关开发者阅读此 PR,了解如何通过简化缓存设计消除冗余和潜在 bug。对于使用 DSA indexer 的模型(如 GLM-5.2)部署可提升内存效率。
补齐 JIT 测试 CI 注册迁移并加固验证规则
值得精读 check_registered_tests.py 的改动,了解如何设计防御性 CI 审核工具以防止回归。其他测试文件的迁移模式可作为后续 CI 注册的标准范例。
跳过不稳定的 NIXL HiSparse 测试
可合并。作为临时缓解措施,长期应分析测试失败根因并修复。
清理DeepSeek V3.2测试并升级GLM测试至5.2
本PR属于测试清理维护,技术含量较低,但体现了团队及时清理过时测试资源的良好实践。若关注GLM或DeepSeek测试架构,可了解测试注册模式(register_cuda_ci)。
参与讨论