修复 FlashInfer SWA KV 索引导致 DFlash 坍缩
值得精读,尤其是需要在注意力后端中支持 SWA 缓存或推测解码的开发者。实现了与 TRTLLM 后端的策略统一,设计思路清晰。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 FlashInfer SWA KV 索引导致 DFlash 坍缩
值得精读,尤其是需要在注意力后端中支持 SWA 缓存或推测解码的开发者。实现了与 TRTLLM 后端的策略统一,设计思路清晰。
为 Kimi K2.7 Code 添加部署 cookbook
该 PR 属于常规文档维护,适合需要部署 Kimi-K2.7-Code 的用户精读。交互式命令生成器组件的设计模式(options 驱动、动态 fallback)可为后续类似文档组件参考。
修复EAGLE下静态显存分数未计入draft KV缓存导致OOM
此PR是一次重要的内存管理重构,修复了长期存在的draft模型显存预算缺失问题。设计上将初始化阶段清晰分离,提高了可维护性和可预测性。建议所有使用推测解码的团队精读,尤其是`init_model_worker`的编排逻辑和各worker的`alloc_memory_pool`/`init_backends`实现。
为 srt/platforms 添加 codeowner
可直接合并,无技术风险。
消除 FP8 blockwise GEMM 每调用填充开销
推荐精读该 PR,特别是 `sglang_per_token_group_quant_fp8_row_padded` 的实现与注释。它清晰地表达了优化动机、正确性论证(行独立性保证)以及 fallback 策略。测试文件 `test_fp8_blockwise_row_padding.py` 展示了如何通过对比 legacy 路径保证位精确性,值得参考。
原始 PR · 作者 JustinTong0323 · 合并时间 2026-06-12 23:42
修正 MiniMax-M3 基准测试为热稳态数据
此 PR 是文档修正,技术含量不高,但值得关注其对基准测试方法的澄清:准确区分冷启动与热稳态,对社区用户有参考价值。此外,B200 MSA 路径在负载下的准确率漂移是一个值得后续追踪的研究方向。
为 MiniMax-M3 模型添加完整 cookbook 部署文档
该 PR 为纯文档变更,值得阅读以了解新模型支持的完整流程和基准性能数据,但其本身无需要重点关注的设计决策。
原始 PR · 作者 JustinTong0323 · 合并时间 2026-06-12 21:14
添加 MiniMax-M3 模型部署与性能基准文档
对于计划部署 MiniMax-M3 的团队,建议仔细阅读此文档。对于贡献者,该 PR 展示了 SGLang 文档系统中 config-driven 的部署面板模式,值得参考。
参与讨论