Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 22:27 同步状态:空闲 下次计划:2026-09-03 23:27

PR 列表

更多筛选
2026-06-29

#29382 [CPU] use faster exp in silu_and_mul

原始 PR · 作者 mingfeima · 合并时间 2026-06-29 09:38

性能优化 重要性 4.70 洞察度 3.00

CPU siLU-and-mul 使用更快 exp_u20 近似

值得合并,变更风险低且收益明确。建议后续将类似近似应用于其他激活函数(如 gelu_tanh_and_mul)的向量化路径,以获得更多加速。

#29378 [CPU] enable fused_sigmoid_mul on CPU device

原始 PR · 作者 mingfeima · 合并时间 2026-06-29 09:38

功能 重要性 7.29 洞察度 5.00

为 CPU 添加 fused_sigmoid_mul 内核,优化 Qwen3.5 门控

建议重点关注 CPU 融合算子的添加模式(sgl-kernel + TorchScript 注册 + 模型接入),可复用至其他类似激活融合场景。同时应关注 exp_u20 近似可能引入的精度差异,必要时增强测试覆盖更多 shape 和数值比较。

性能优化 重要性 7.42 洞察度 7.00

消除 dflash+fa3 中 seq_lens_cpu D2H 同步,设备端构建页表

该 PR 值得精读,尤其是以下设计点: 1. **设备端自保护 kernel**:`build_trtllm_mha_page_table` 通过 cache_seqlens 限制写入列,使静态上界成为可能。 2. **渐进式作用域控制**:先将优化限制到 dflash(风险最低),再逐步推广,是大型重构的稳健思路。 3. **冷路径回退策略**:`_host_max_seq_len` 辅助函数隔离了“可能需要主机最大值”的逻辑,使热路径保持纯净。 4. **测试中的 sentinel 方法**:直接检查未写入列是否保持 sentinel,精确验证 kernel 的写边界。

缺陷修复 重要性 6.98 洞察度 3.00

为HostKVCache添加双重释放检测

该 PR 是典型的防御性编程实践,值得相关模块开发者精读。建议关注:如何使用布尔张量实现分配状态追踪、如何通过测试模拟各种异常路径、以及如何用 benchmark 验证性能无退化。对于正在维护 KV 缓存层或内存池的工程师尤其有参考价值。

缺陷修复 重要性 6.77 洞察度 6.00

修复 DSA indexer 融合中 rope buffer 每层重复创建导致内存暴增

值得精读:这是一个典型的高内存泄漏修复案例,展示了将重复计算提取为跨实例共享缓存的模式。代码简洁,逻辑清晰,对理解 DSA indexer 的内存管理有参考价值。

#29229 Fix dummy weight init for tensor subclasses

原始 PR · 作者 aurickq · 合并时间 2026-06-29 01:17

缺陷修复 重要性 5.50 洞察度 4.00

修复张量子类的 dummy 权重初始化

值得合并,修复了低比特张量子类初始化的缺陷。建议后续可添加针对张量子类的单元测试,确保该类边界的正确性。

参与讨论