Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15

PR 列表

更多筛选
2026-08-06
功能 重要性 8.73 洞察度 6.00

CPU 新增 MLA 后端,DeepSeek-V2/V3 可在 CPU 运行

值得精读。重点关注三处设计决策:① 如何通过继承 `MLACommonBackend/Impl` 复用共享 MLA 脚手架,同时用 "跳过父类 `__init__` + 手动复制属性" 规避 GPU kernel 依赖;② 将 CPU 专属的 KV cache 写入逻辑内联进 `do_kv_cache_update` 而非污染公共算子;③ ARM 与 x86 在 `Vectorized<float>` 默认构造语义上的差异如何导致隐性 bug。该 PR 也是后续 CPU MLA 性能优化的起点。

性能优化 重要性 6.11 洞察度 5.00

MTP 场景让 skip_topk 生效,跳过 Indexer 冗余计算

值得精读。该 PR 虽然改动极小(几个 if 条件),但揭示了 MTP 推理中如何通过标志位复用 step 0 计算结果、消除冗余内核调用的设计模式。对于理解 GLM/DSv3.2 的 MTP 实现和 vLLM 中模型层性能优化的手段有参考价值。建议结合 PR body 中的 benchmark 脚本和关联 Issue 了解完整优化脉络。

性能优化 重要性 5.99 洞察度 6.00

DSA decode 内核接入 PDL,重叠启动延迟提升吞吐

值得精读。这是一个把 CUDA 新特性 PDL 同时落到 Triton 与原生 CUDA 两种内核体系的最小但完整范例:Triton 侧展示了 constexpr 门控 + `gdc_wait()` / `gdc_launch_dependents()` + `launch_pdl` 的用法,CUDA 侧展示了 `cudaLaunchKernelEx` + `cudaLaunchAttributeProgrammaticStreamSerialization` 的标准写法。最有价值的设计决策是门控只依赖 `is_arch_support_pdl()` 而非叠加 sm100 判断(review 推动),以及与 #49792 冲突时选择保留 CuTeDSL 主路径、PDL 落到 Triton fallback 的分层策略。若不在 Blackwell 硬件上开发,可快速浏览即可。

功能 重要性 6.93 洞察度 4.00

HPC 注意力后端支持 bf16 KV cache 配合 FP8 权重

值得精读 `vllm/v1/attention/backends/hpc_attn.py`,重点看 `hpc_kv_written` 信号与 `_dynamic_sched` 兼容设计;对要扩展自定义 attention 后端的开发者有借鉴意义。合并前建议至少补一个 bf16 KV cache 的 e2e 或单元测试。

缺陷修复 重要性 7.14 洞察度 5.00

补 ROCm AITER add-RMSNorm 死残差融合,重构稳定性测试

值得精读。核心亮点是:通过继承既有 pattern 并只取第一个输出,用约 30 行代码补齐一个生产覆盖缺口;测试设计(四个独立融合站点 + 宽松 FP8 包络 + 严格 bf16 断言)可作后续融合测试模板。对 ROCm 编译路径维护者有直接参考价值,评审中端到端精度验证的答复方式也值得借鉴。

缺陷修复 重要性 6.81 洞察度 5.00

修复 hidden-state 缓存层破坏混合前缀缓存分块导致的启动崩溃

值得精读。此 PR 展示了典型的"隐式全局状态耦合导致启发式判断失效"的回归修复:EngineCore 全局重置 `cache_config.block_size` 的时序行为与 `kv_cache_utils` 推断逻辑之间的隐性依赖。修复思路(用模式判断替代数值比较、用 GCD 因子约束保证整除性)对维护 V1 hybrid KV cache 的工程师有直接参考价值;同时可关注 ivanium 提出的 follow-up:将 GCD 逻辑统一收敛进 `resolve_kv_cache_block_sizes`。

#49932 [Linear] [Kernel] add block-wise scaled_mm

原始 PR · 作者 zufangzhu · 合并时间 2026-08-06 14:40

功能 重要性 7.77 洞察度 4.00

新增基于 torch._scaled_mm 的 FP8 block-scale 内核后端

值得精读:它示范了 vLLM 内核抽象中的三件套(is_supported / can_implement / apply_*)如何承接平台能力探测与数据布局契约,尤其是基于 PyTorch 上游实现约束做剪裁并可回退的设计。对要扩展 FP8 block-scale 后端或接入 cuBLASLt 新特性的同学有参考价值。建议同时关注其随 PyTorch 版本的兼容性回归测试。

参与讨论