优化 NSA 后端元数据生成逻辑,提升推测解码场景下的 GPU 性能。
建议关注新 Triton 内核 `seqlens_expand_triton` 的设计,以及如何将 CPU 端逻辑迁移到 GPU 以提升性能。该 PR 值得精读,学习 GPU 优化技巧和推测解码下的元数据处理策略。
SGLang is a high-performance serving framework for large language models and multimodal models.
优化 NSA 后端元数据生成逻辑,提升推测解码场景下的 GPU 性能。
建议关注新 Triton 内核 `seqlens_expand_triton` 的设计,以及如何将 CPU 端逻辑迁移到 GPU 以提升性能。该 PR 值得精读,学习 GPU 优化技巧和推测解码下的元数据处理策略。
原始 PR · 作者 ZiguanWang · 合并时间 2026-02-27 03:50
通过调优 fused_moe_triton 内核并添加 int4_w4a16 支持,显著提升 Kimi K2.5 模型在 AMD 硬件上的性能。
建议工程师精读此 PR,特别是关注 int4_w4a16 量化支持的具体实现(如权重初始化和尺度计算)和调优配置的选取策略,这对高性能计算和量化优化有参考价值。
原始 PR · 作者 silencejade · 合并时间 2026-02-25 09:16
修改MultiPlatformOp中forward_npu方法默认调用原生实现以支持NPU模型。
建议阅读此PR以理解MultiPlatformOp中平台特定方法的默认实现模式,关注设计决策:在兼容性和性能之间的平衡。对于从事NPU或多平台开发的工程师,这是一个基础但重要的变更,值得学习如何通过基类修复影响广泛的兼容性问题。
参与讨论