修复 Qwen-VL ViT CUDA graph 按布局复用与工作区地址绑定
值得精读。重点学习两个设计决策:一是 CUDA graph key 必须包含请求级元数据(仅按长度复用是典型的 graph 陷阱);二是用“退役旧分配 + 按 graph 绑定地址”解决 capture 后地址失效问题。`_sequence_layout_key` 把同步从查找路径挪到 CPU 预处理的做法,也值得其他 CUDA graph runner 复用。
标签列表
聚合结果
修复 Qwen-VL ViT CUDA graph 按布局复用与工作区地址绑定
值得精读。重点学习两个设计决策:一是 CUDA graph key 必须包含请求级元数据(仅按长度复用是典型的 graph 陷阱);二是用“退役旧分配 + 按 graph 绑定地址”解决 capture 后地址失效问题。`_sequence_layout_key` 把同步从查找路径挪到 CPU 预处理的做法,也值得其他 CUDA graph runner 复用。
HIP 使能 DSA draft_extend CUDA graph 捕获
值得精读,尤其是 CUDA graph 捕获的允许列表设计。这是一个小幅但影响明确的性能优化,展示了如何通过后端隔离和本地导入实现跨平台支持。建议关注后续对 DSA HIP 的测试覆盖和长期稳定性。
原始 PR · 作者 AliceChenyy · 合并时间 2026-08-25 08:42
SM120 flash_mla 分页缓冲改在推断模式外分配
值得精读,但仅面向关注 SM120 内核和 CUDA graph 相关机制的工程师。核心设计决策是保持惰性缓冲区分配与使用模式一致性,并修复不对称保护。可借鉴其注释说明写法,但实现简单,无需深度分析。
原始 PR · 作者 elvischenv · 合并时间 2026-08-20 05:13
修复 DP attention 下 Nemotron-H Mamba CUDA graph 崩溃
值得精读,因为它展示了 DP attention 与 CUDA graph 后端交互时的关键坑点及修复模式,尤其对从事模型推理内核和 CUDA graph 优化的工程师有参考价值。关注点:如何将 eager 路径与 CUDA graph 路径统一,以及 `fuse_mlp_allreduce` 在 DP 下的特殊处理。
原始 PR · 作者 charlotte12l · 合并时间 2026-08-04 17:23
仅 DP 路径保留 CG 捕获输入,prefill 图内存减约 0.87 GB
值得花约 5 分钟精读。它展示了一个极小的条件门控如何消除 CUDA graph 捕获阶段不必要的对象生命周期管理,同时保持 DP 路径语义完全不变。值得关注的设计决策是用 global_num_tokens_gpu is not None 作为 capture-only 张量存在性的代理标志,避免了引入显式状态位;读者可结合 #31682 一起阅读,理解 SGLang 中 runner/backend 分层下参数传递契约的演进。
修复 Mamba2 CUDA 图回放跟踪缓冲区尾部脏读
此修复定位精准、改动最小、测试充分,建议合并。开发者在合并前应确认所有相关 CI 通过。
回退 Full Cuda Graph 与 page_size=1 兼容变更
建议快速合并以恢复 CI,后续若需重新启用该功能,应充分测试后再提交。
修复 FA4 与 full prefill CUDA graph 的 page_size 冲突
可合并,变更简单且正确。建议后续增加测试覆盖该组合场景。