Prhub

sgl-project/sglang · 标签视图

标签列表

聚合结果

cuda-graph 相关 PR

2026-08-30
缺陷修复 重要性 8.70 洞察度 6.00

修复 Qwen-VL ViT CUDA graph 按布局复用与工作区地址绑定

值得精读。重点学习两个设计决策:一是 CUDA graph key 必须包含请求级元数据(仅按长度复用是典型的 graph 陷阱);二是用“退役旧分配 + 按 graph 绑定地址”解决 capture 后地址失效问题。`_sequence_layout_key` 把同步从查找路径挪到 CPU 预处理的做法,也值得其他 CUDA graph runner 复用。

2026-08-25
功能 重要性 5.59 洞察度 4.00

HIP 使能 DSA draft_extend CUDA graph 捕获

值得精读,尤其是 CUDA graph 捕获的允许列表设计。这是一个小幅但影响明确的性能优化,展示了如何通过后端隔离和本地导入实现跨平台支持。建议关注后续对 DSA HIP 的测试覆盖和长期稳定性。

缺陷修复 重要性 3.95 洞察度 4.00

SM120 flash_mla 分页缓冲改在推断模式外分配

值得精读,但仅面向关注 SM120 内核和 CUDA graph 相关机制的工程师。核心设计决策是保持惰性缓冲区分配与使用模式一致性,并修复不对称保护。可借鉴其注释说明写法,但实现简单,无需深度分析。

2026-08-20
缺陷修复 重要性 5.92 洞察度 5.00

修复 DP attention 下 Nemotron-H Mamba CUDA graph 崩溃

值得精读,因为它展示了 DP attention 与 CUDA graph 后端交互时的关键坑点及修复模式,尤其对从事模型推理内核和 CUDA graph 优化的工程师有参考价值。关注点:如何将 eager 路径与 CUDA graph 路径统一,以及 `fuse_mlp_allreduce` 在 DP 下的特殊处理。

2026-08-04
性能优化 重要性 5.74 洞察度 4.00

仅 DP 路径保留 CG 捕获输入,prefill 图内存减约 0.87 GB

值得花约 5 分钟精读。它展示了一个极小的条件门控如何消除 CUDA graph 捕获阶段不必要的对象生命周期管理,同时保持 DP 路径语义完全不变。值得关注的设计决策是用 global_num_tokens_gpu is not None 作为 capture-only 张量存在性的代理标志,避免了引入显式状态位;读者可结合 #31682 一起阅读,理解 SGLang 中 runner/backend 分层下参数传递契约的演进。

2026-07-30
2026-07-14