Prhub

vllm-project/vllm · 标签视图

标签列表

聚合结果

cudagraph 相关 PR

2026-08-20
缺陷修复 重要性 5.02 洞察度 5.00

修复 ROCm CUDA graph capture 时 CPU query offset 被清除

值得精读,尤其是关注 ROCm CUDA graph capture 细节的开发者。该 PR 揭示了一个隐藏在共享 metadata 状态下的时序问题,并提供了最小化的修复方案,展示在性能和安全捕获之间的权衡。可作为处理类似共享状态清理问题的参考案例。

2026-08-17
缺陷修复 重要性 5.85 洞察度 5.00

修复 breakable CUDA graph 下 DSV4 indexer 打分被跳过

值得精读。改动虽小,但精准打击了 CUDA graph capture 语义与运行时动态条件分支的冲突,是 breakable graphs 场景下极具代表性的正确性修复。建议与 #52448 issue 的根因剖析、#52401 的 region 选择方案、#51318 的元数据回退一起阅读,能完整理解 DSV4 稀疏 MLA 在 CUDA graph 下的演进脉络。

测试 重要性 4.47 洞察度 4.00

在 AMD gfx950 上启用 ViT/encoder CUDA graph 测试

该 PR 值得快速浏览,主要价值在于 CI 测试扩展的组织方式:通过 `is_cuda_alike()` 统一平台判定、利用 `--ignore` 避免重复执行、将小测试整合进既有步骤而非新增独立步骤,这对维护多硬件 CI 矩阵有借鉴意义。若关心 ROCm 平台支持或 CI 效率,建议精读 `.buildkite/test-amd.yaml` 的改动与 review 讨论;若只关注推理内核逻辑,则无需深入。

2026-08-16
缺陷修复 重要性 8.29 洞察度 6.00

按 runner 选择 DSV4 eager 区域,修复 MRV1 并恢复 ROCm 默认

值得精读。PR 展示了比配置层"一刀切拒绝"更优雅的解法:把 runner 差异下沉到模型层,用函数指针选择 eager region,既保住 CUDA 的 TTFT 优化,又恢复 ROCm 的 MRV1 性能。对理解 vLLM 的 piecewise cudagraph 捕获机制(`eager_break_during_capture`、`_capturing` 时序)很有价值。需要留意的长期风险是函数指针间接层与配置兜底的移除。

2026-08-14
功能 重要性 7.70 洞察度 5.00

MRV2 多模态编码器启用 CUDA Graph 捕获与执行

值得精读。重点看 encoder_runner.py 的双路径回退设计、model_states/interface.py 中 manager 生命周期与门控条件,以及 model_runner.py 中 encoder/decoder 捕获的解耦编排。后续可关注编码器捕获是否会被移出 dummy LoRA 上下文,以及 is_captured 状态机在配置变更场景下的行为。

2026-08-12
缺陷修复 重要性 5.17 洞察度 4.00

XPU 上 GDN 注意力改走 eager,修复 Qwen3.5 图捕获乱码

值得精读,尤其适合了解 vLLM 的 breakable cudagraph 机制与自定义算子注册流程,是理解“哪些算子不能固化进图”的典型案例。若在 XPU 上运行 Qwen3.5 等混合模型并开启 breakable cudagraph,建议合入该修复。未来可关注是否有补充回归测试的后续 PR。

重构 重要性 6.19 洞察度 3.00

删除冗余 uniform token 计数包装,统一 decode API

这是一个行为保持的小型重构,不值得花大量时间精读,但适合快速浏览以理解 MRv2 中 uniform token count 与 CUDA 图 dispatch 的关系。建议重点结合 #51865 的原始 bugfix 一起看:该 PR 修复了投机解码下全图误重放问题,本 PR 则消除了随之引入的 API 重复。若后续继续演进 MRv2 CUDA 图调度,需要注意 `has_prefill=False` 这一隐性契约。

缺陷修复 重要性 8.86 洞察度 6.00

统一解码批须校验请求状态,修复投机解码全图误重放

值得精读。核心看点有三:一是 `prepare_inputs` 拆分出 `gather_batch_req_state` 并前置到 DP 同步之前的设计——把 CPU 侧轻量预判与 GPU 输入装配解耦,既服务于跨 DP 图模式选择又避免了重复计算;二是“形状 + 状态”双条件分类的语义分层,`get_uniform_token_count` 与 `get_uniform_decode_token_count` 的边界通过 docstring 固化;三是 AST 扫描回归测试,针对 speculator 复制粘贴文化做的防退化设计,可推广到其他同类高风险调用点。