Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 03:32 同步状态:空闲 下次计划:2026-09-05 04:32

PR 列表

更多筛选
2026-07-15
缺陷修复 重要性 7.49 洞察度 6.00

MoE 输出分配至对称内存池,allreduce 延迟降 50%

值得精读,尤其是 `use_symmetric_memory` 上下文管理器的条件使用模式,以及通过上游分配消除下游数据复制的思路。该 PR 展示了在分布式训练/推理框架中精细控制内存分配位置以获得通信性能优化的典型方法。

#31171 [CPU] add fused input proj for qwen3.5

原始 PR · 作者 mingfeima · 合并时间 2026-07-15 15:06

性能优化 重要性 8.02 洞察度 5.00

为 Qwen3.5 CPU 添加融合输入投影内核

推荐阅读。该 PR 展示了如何在 SGLang 中为特定 CPU 硬件(Intel AMX)高效实现内核融合的完整流程:从 C++ 内核实现、Torch 扩展注册、torch.compile 兼容、到模型集成和测试。LazyValue 条件启用模式值得借鉴。对于关注 CPU 推理性能的开发者有直接参考价值。

功能 重要性 9.18 洞察度 7.00

为 KDA 添加 FlashInfer SM100 解码和 MTP 验证后端

此 PR 设计思路清晰,验证严谨,适合以下读者精读: 1. 对线性注意力推测解码实现感兴趣者,可学习其数值验证方法(per-step checkpoint 匹配)和硬件特定后端集成模式。 2. KDA 模型使用者,应了解配置选项和限制(topk=1,SM100)。 3. 关注卷积窗口布局问题的开发者,可参考 `memory_pool.py` 中的条件处理。 值得关注的设计决策:将 FlashInfer 定位为纯 decode+verify 后端,prefill 保留 Triton,避免依赖 FlashInfer 不支持的 chunk kernel。

封装KV分配记账到分配函数

值得精读。此 PR 演示了如何在大型代码库中进行安全的大规模重构:使用机械验证确保纯移动正确,用等价性审查确认语义变更,通过多步提交渐进式推进。对于关注代码架构和重构技巧的工程师,这是很好的学习案例。

提取分配逻辑到新文件 allocation.py 和 allocation_sizing.py

推荐精读,该 PR 展示了大规模机械重构的实践:通过 AST 搬迁工具确保纯搬迁可重现,并用清晰的提交结构(prep + move + postpare)管理重构链。对关注代码组织和模块拆分的读者有参考价值。

缺陷修复 重要性 6.07 洞察度 5.00

修复以 req_pool_idx 代理判断 KV 资源存在性的问题

该 PR 是 `req_pool_idx` / KV 资源解耦的关键环节,设计思路明确,变更谨慎。但需关注 `scheduler.py` 中可能的断言失败风险,建议在后续版本中添加安全守卫或确认调用点前置条件。值得作为属性解耦的参考案例学习。

重构 重要性 6.74 洞察度 5.00

用 req.kv 存在性表示 KV 资源是否已分配

值得精读。该 PR 是 SGLang KV 生命周期解耦系列的重要基石,展示了如何用类型系统和对象存在性代替代理字段管理资源。阅读时可以重点关注 `schedule_batch.py` 中 `Req` 的初始化、`reset_for_retract` 中的断言以及 `mem_cache/common.py` 中 `release_kv_cache` 的结尾变更。

解耦缓存后端与KV committed细节,移除记账标志

此 PR 是系列重构中的一环,展示了如何通过接口解耦来简化状态管理。推荐希望理解 SGLang KV 缓存架构的工程师精读,特别是 `cache_finished_req` 签名变化和 `effective_kv_committed_len` 的引入。

参与讨论