CPU siLU-and-mul 使用更快 exp_u20 近似
值得合并,变更风险低且收益明确。建议后续将类似近似应用于其他激活函数(如 gelu_tanh_and_mul)的向量化路径,以获得更多加速。
SGLang is a high-performance serving framework for large language models and multimodal models.
CPU siLU-and-mul 使用更快 exp_u20 近似
值得合并,变更风险低且收益明确。建议后续将类似近似应用于其他激活函数(如 gelu_tanh_and_mul)的向量化路径,以获得更多加速。
统一替换 --cuda-graph-max-bs 为 --cuda-graph-max-bs-decode
建议立即合入,属于有益的技术债务清理。作者提供的验证脚本可作为类似重命名操作的参考。
为 CPU 添加 fused_sigmoid_mul 内核,优化 Qwen3.5 门控
建议重点关注 CPU 融合算子的添加模式(sgl-kernel + TorchScript 注册 + 模型接入),可复用至其他类似激活融合场景。同时应关注 exp_u20 近似可能引入的精度差异,必要时增强测试覆盖更多 shape 和数值比较。
原始 PR · 作者 polisettyvarma · 合并时间 2026-06-29 09:10
XPU profiling 支持与步数增强
值得精读。该 PR 展示了如何为 benchmark 工具统一添加硬件 profiling 支持,设计简洁,可扩展性强。关注点在于 `start_profile` 接口的设计是否兼容所有 backend。
消除 dflash+fa3 中 seq_lens_cpu D2H 同步,设备端构建页表
该 PR 值得精读,尤其是以下设计点: 1. **设备端自保护 kernel**:`build_trtllm_mha_page_table` 通过 cache_seqlens 限制写入列,使静态上界成为可能。 2. **渐进式作用域控制**:先将优化限制到 dflash(风险最低),再逐步推广,是大型重构的稳健思路。 3. **冷路径回退策略**:`_host_max_seq_len` 辅助函数隔离了“可能需要主机最大值”的逻辑,使热路径保持纯净。 4. **测试中的 sentinel 方法**:直接检查未写入列是否保持 sentinel,精确验证 kernel 的写边界。
为HostKVCache添加双重释放检测
该 PR 是典型的防御性编程实践,值得相关模块开发者精读。建议关注:如何使用布尔张量实现分配状态追踪、如何通过测试模拟各种异常路径、以及如何用 benchmark 验证性能无退化。对于正在维护 KV 缓存层或内存池的工程师尤其有参考价值。
修复 DSA indexer 融合中 rope buffer 每层重复创建导致内存暴增
值得精读:这是一个典型的高内存泄漏修复案例,展示了将重复计算提取为跨实例共享缓存的模式。代码简洁,逻辑清晰,对理解 DSA indexer 的内存管理有参考价值。
修复张量子类的 dummy 权重初始化
值得合并,修复了低比特张量子类初始化的缺陷。建议后续可添加针对张量子类的单元测试,确保该类边界的正确性。
参与讨论