移除废弃的 NVFP4 JIT 内核及 CUTLASS MoE 后端
值得精读,特别是对于关注内核演进和代码清理的读者。展示了如何基于社区替代品逐步淘汰遗留内核,并在过程中处理测试、文档和配置的联动清理。设计决策(如使用早期断言拒绝未使用路径)值得借鉴。
SGLang is a high-performance serving framework for large language models and multimodal models.
移除废弃的 NVFP4 JIT 内核及 CUTLASS MoE 后端
值得精读,特别是对于关注内核演进和代码清理的读者。展示了如何基于社区替代品逐步淘汰遗留内核,并在过程中处理测试、文档和配置的联动清理。设计决策(如使用早期断言拒绝未使用路径)值得借鉴。
原始 PR · 作者 polisettyvarma · 合并时间 2026-07-14 09:21
XPU 通过 sgl-kernel 支持 Hadamard 变换
作为 DeepSeek V4 XPU 支持系列的一部分,本 PR 实现简洁,风险低。若需在 XPU 环境运行 DeepSeek-V4,建议合入。注意测试文件未包含在最终变更中(移至 kernel 侧)。
迁移 srt/layers 散落内核至 sglang.kernels
作为 Phase 2.5 的重要一环,适合架构组和维护者精读,了解内核迁移的目录约定和注册模板。review 中指出的 missing import 和防御性断言可作为后续 PR 改进的参考。建议在后续 PR 中补充这些断言并修复遗漏的导入。
原始 PR · 作者 polisettyvarma · 合并时间 2026-07-14 09:20
XPU上使用sgl-kernel实现fused_q_indexer_rope_hadamard_quant
值得合并,变更简洁且目标明确。建议后续添加单元测试并关注 mingfeima 提出的简化建议。
将 ~42 个 MoE Triton 内核从 srt/layers/moe 迁移至 sglang.kernels
值得精读,特别是对内核重构和代码迁移感兴趣的同学。本 PR 展示了大规模代码移动的实践:使用 `git mv` 保留历史、批量更新导入、处理合并冲突。讨论中的自动审查问题提醒我们需要关注原始代码中的缺陷。
原始 PR · 作者 alisonshao · 合并时间 2026-07-14 08:53
用 torch.assert_close 替代 triton 版本,加速约 1400x
值得立即合并,是一项高性价比的 CI 优化。建议在类似多 GPU 测试中推广使用 `torch.testing.assert_close` 替代 `triton.testing.assert_close`,以减少 CPU 拷贝开销。
修复 Kimi-VL 编码器数据并行与 TP 逻辑
该 PR 值得精读,尤其是编码器 DP/TP 集成的模式、CUDA graph 捕获中条件逃逸设计,以及位置推断缓存的 LRU 实现。对于需要支持同类多模态模型的开发者有借鉴意义。
原始 PR · 作者 jinzhen-lin · 合并时间 2026-07-14 08:42
集成 Humming 量化内核,提升 MoE 推理性能
值得精读,尤其是 `quantization/humming.py` 的量化方法选择逻辑和 `moe_runner/humming.py` 的 GEMM 类型调度。设计上的权衡(fallback、lazy import、layer 引用传递)对其他后端集成具有参考意义。建议跟进者关注即将到来的测试补充和依赖可选化议题。
参与讨论