Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51

PR 列表

更多筛选
2026-06-13

#27737 flashinfer swa kv pool fix (dflash gemma 4)

原始 PR · 作者 dcw02 · 合并时间 2026-06-13 02:35

缺陷修复 重要性 6.73 洞察度 5.00

修复 FlashInfer SWA KV 索引导致 DFlash 坍缩

值得精读,尤其是需要在注意力后端中支持 SWA 缓存或推测解码的开发者。实现了与 TRTLLM 后端的策略统一,设计思路清晰。

#28064 [Docs] Add Kimi K2.7 Code cookbook

原始 PR · 作者 mmangkad · 合并时间 2026-06-13 02:19

文档 重要性 7.40 洞察度 2.00

为 Kimi K2.7 Code 添加部署 cookbook

该 PR 属于常规文档维护,适合需要部署 Kimi-K2.7-Code 的用户精读。交互式命令生成器组件的设计模式(options 驱动、动态 fallback)可为后续类似文档组件参考。

缺陷修复 重要性 9.36 洞察度 6.00

修复EAGLE下静态显存分数未计入draft KV缓存导致OOM

此PR是一次重要的内存管理重构,修复了长期存在的draft模型显存预算缺失问题。设计上将初始化阶段清晰分离,提高了可维护性和可预测性。建议所有使用推测解码的团队精读,尤其是`init_model_worker`的编排逻辑和各worker的`alloc_memory_pool`/`init_backends`实现。

性能优化 重要性 7.73 洞察度 5.00

消除 FP8 blockwise GEMM 每调用填充开销

推荐精读该 PR,特别是 `sglang_per_token_group_quant_fp8_row_padded` 的实现与注释。它清晰地表达了优化动机、正确性论证(行独立性保证)以及 fallback 策略。测试文件 `test_fp8_blockwise_row_padding.py` 展示了如何通过对比 legacy 路径保证位精确性,值得参考。

2026-06-12
文档 重要性 5.54 洞察度 4.00

修正 MiniMax-M3 基准测试为热稳态数据

此 PR 是文档修正,技术含量不高,但值得关注其对基准测试方法的澄清:准确区分冷启动与热稳态,对社区用户有参考价值。此外,B200 MSA 路径在负载下的准确率漂移是一个值得后续追踪的研究方向。

#28061 docs

原始 PR · 作者 yhyang201 · 合并时间 2026-06-12 21:19

文档 重要性 7.64 洞察度 3.00

为 MiniMax-M3 模型添加完整 cookbook 部署文档

该 PR 为纯文档变更,值得阅读以了解新模型支持的完整流程和基准性能数据,但其本身无需要重点关注的设计决策。

#28060 docs

原始 PR · 作者 JustinTong0323 · 合并时间 2026-06-12 21:14

文档 重要性 7.64 洞察度 3.00

添加 MiniMax-M3 模型部署与性能基准文档

对于计划部署 MiniMax-M3 的团队,建议仔细阅读此文档。对于贡献者,该 PR 展示了 SGLang 文档系统中 config-driven 的部署面板模式,值得参考。

参与讨论