Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51

PR 列表

更多筛选
2026-06-25
性能优化 重要性 9.36 洞察度 7.00

为GLM5引入BCG支持并优化prefill性能

强烈建议精读。本 PR 展示了如何在推理框架中平衡 eager 与 CUDA 图执行,是 CUDA 图后端演进的关键步骤。特别关注 `MlaBmmFusionPlan` 和 `mla_bmm_then_unified_attention` 的设计,以及在 split op 中灵活切换 eager 与图的策略。讨论中的设计取舍值得团队参考。

#28749 Fix nightly CI test for GLM-4.6 + B200

原始 PR · 作者 b8zhong · 合并时间 2026-06-25 03:34

缺陷修复 重要性 4.88 洞察度 3.00

修复 GLM-4.6 在 B200 上的 CI 失败

建议快速合入。这是一个针对硬件特定配置的精准修复,改动量小且经过验证。

性能优化 重要性 4.94 洞察度 4.00

优化 draft extend 的 select_index 计算

该 PR 极小且安全,建议直接合并。虽无测试覆盖,但由于逻辑等价且改动简单,风险可控。对于追求极致性能的工程师,可关注此类微优化;对于一般开发者,可快速略过。

#28952 Add DeepSeek V4 Flash demo notebook

原始 PR · 作者 anushapant · 合并时间 2026-06-25 02:42

文档 重要性 4.62 洞察度 3.00

添加 DeepSeek-V4-Flash 演示 notebook

该 PR 适合作为入门参考,尤其是需要快速体验 DeepSeek-V4-Flash 长上下文能力的用户。但技术人员若关注推理引擎深度优化,可跳过此 PR。

#29098 Extract profile request cleanups

原始 PR · 作者 merrymercy · 合并时间 2026-06-25 02:22

重构 重要性 8.09 洞察度 5.00

统一 ProfileReqInput 为 ProfileReq 并清理接口

推荐阅读 `io_struct.py` 和 `common.py` 中的重构模式。核心设计决策包括:① 将 `ProfileReqType` 枚举作为 `ProfileReq` 的成员,避免外部重复定义;② 通过 `normalize_serialized_named_tensor_payloads` 统一多来源tensor数据的格式,可以作为一种数据清洗模式在其他场景复用。

重构 重要性 6.83 洞察度 5.00

共享 prefill 和 decode 的 CUDA graph 内存池

值得精读。该 PR 展示了如何通过共享全局资源来减少内存占用,且改动极小(+26/-8)。适合作为类似共享池模式(如 EAGLE 的 draft pool)的参考。

参与讨论