Prhub

sgl-project/sglang · 标签视图

标签列表

聚合结果

linear-attention 相关 PR

2026-07-28
性能优化 重要性 8.71 洞察度 7.00

削减 MTP spec-v2 主机缝隙开销,GPU 利用率 67% 提升至 95%

值得精读。四个看点:① 对 event_loop_overlap / FutureMap 主机 run-ahead 的分析是理解 SGLang CUDA-graph 调度瓶颈的绝佳材料;② 每个改动独立可回退且附 byte-identical 论证,是性能优化可验收性的范本;③ review 中抓到的 plan-stream 竞态说明此类“搬移 / 融合”改动极易引入时序依赖,值得作为安全检查清单;④ fail-loud(NotImplementedError)与显式门控回退的取舍清晰。

2026-07-20

#28695 [GDN] Support ReplaySSM Ring Spec-Verify

原始 PR · 作者 yuan-luo · 合并时间 2026-07-20 22:06

功能 重要性 8.33 洞察度 7.00

环形缓存替换GDN推测验证路径,显存降低11.5GB

该PR展示了从学术论文到工程落地的完整过程,包含误差分析、双路径设计、性能调优和验证。对于从事推测解码、线性注意力或显存优化的开发者有很高学习价值。建议仔细阅读 `gdn_replayssm_spec_decode.py` 中的内核实现和精度讨论。

2026-07-16
性能优化 重要性 6.96 洞察度 6.00

融合 SM100 CuteDSL 预填充状态 I/O 至 h 内核

值得精读。该 PR 展示了一个典型的 kernel fusion 模式——将 PyTorch 级别的内存操作融合进 CUDA kernel 内部,显著减少 kernel launch 和中间带宽。设计上通过可选的 index 参数保持向后兼容,测试通过 bit-identical 断言确保正确性,这些做法值得推广。

2026-06-18
性能优化 重要性 7.86 洞察度 6.00

使用滑动窗口布局去重 Mamba spec 卷积中间缓存,内存减半

值得精读:展示了巧妙的滑动窗口去重思路、Triton kernel 的正确性验证流程(布局测试 + bit-exact + E2E md5)。设计决策(条件启用、参数透传)和实践(`as_strided` 视图的谨慎使用)有参考价值。建议关注 `max_mamba_cache_size` 的 follow-up 优化。

2026-06-10

#27488 [KDA] Add CuteDSL Prefill Kernel on SM100

原始 PR · 作者 yuan-luo · 合并时间 2026-06-10 21:25

功能 重要性 9.36 洞察度 7.00

新增KDA SM100 CuteDSL预填充内核

建议深入阅读`__init__.py`中的数值修复方案(sub-chunk归一化处理per-channel gate)和`_kda_workspace`的缓存设计,是高性能算子实现的优秀示例。同时了解如何通过TMA和MMA编程在Blackwell上实现高效sequence-parallel内核。