Prhub

vllm-project/vllm · 标签视图

标签列表

聚合结果

performance 相关 PR

2026-08-20
性能优化 重要性 8.17 洞察度 6.00

ROCm 融合 DSV4 mHC 与 RMSNorm 内核,吞吐约增 1%

值得精读,尤其是对 kernel 融合接入模式和 ROCm 后端开发有兴趣的工程师。重点关注三点:`_aiter_ops.py` 中 `mhc_fused_post_pre` 的返回值顺序转换与空 token 分支、`model.py` 中融合能力的条件探测(`hc_mult == 4` + hidden size 白名单)、以及 `mhc.py` 各 `forward_hip` 中 AITER/TileLang/torch 的三级回退结构。若后续推广类似融合,建议补上覆盖 fake/meta 与回退路径的单元测试,并考虑把 hidden size 白名单收敛为 AITER 侧的查询接口,避免多处硬编码。

性能优化 重要性 6.04 洞察度 5.00

优化 GDN 元数据构建重复 mask 计算

该 PR 是一个小范围性能优化,逻辑清晰,风险低,值得合并。但建议补充相关单元测试以覆盖 spec decode 边界情况,防止未来回归。

功能 重要性 5.64 洞察度 5.00

默认启用 FlashInfer all-reduce 并跳过批不变模式

值得精读,重点关注默认开启带来的性能变化以及批不变模式的兼容性处理。建议运行更多平台和形状的测试以验证鲁棒性。

缺陷修复 重要性 5.29 洞察度 4.00

为 benchmark_moe.py 新增 Kimi K3 MoE 参数解析分支

值得快速阅读并纳入 benchmark 工具链。虽然改动很小,但展示了多模态模型 MoE config 解析的两个易踩坑点:参数嵌套在 `text_config` 中、top-k 字段命名差异(`num_experts_per_token` vs `num_experts_per_tok`)。建议后续为 `get_model_params()` 补充针对不同架构 config 的单元测试,固化字段名映射,防止未来架构新增时再次回退崩溃。

2026-08-19
缺陷修复 重要性 7.70 洞察度 5.00

修复非 AMX CPU 上 GDN conv 回退慢路径,启用 C++ 内核

值得精读。核心看点是“门控条件与内核真实指令依赖对齐”这一 bug 的定位方法:C++ 内核用 VDPBF16PS 而非 AMX tiles,却被 `is_amx` 挡在门外。配套的 float32 state、SD 布局、权重预打包三处同步放宽,展示了平台级功能开关需要端到端一致的典型模式;新增 fp32 oracle 测试的断言设计也值得借鉴。

性能优化 重要性 7.71 洞察度 6.00

跳过 prefix-cache 覆盖项的 mm 张量广播,多模态 TTFT 显著下降

值得精读。该 PR 展示了一个典型的「基于前缀缓存状态做数据传输裁剪」的设计模式:通过 `num_computed_tokens` 判断数据是否必然不会被消费,从而在广播前剥离。重点关注 `strip_covered_mm_data` 的 M-RoPE 特判(`keep_on_cpu`)以及调度器如何传递 `uses_mrope`。同时建议结合 PR#52827 阅读,理解 `keep_on_cpu` 字段语义。对于 v1 runner 的 preemption 场景,若有后续演进可关注是否需要恢复该路径。

性能优化 重要性 3.18 洞察度 6.00

SM120 FP8 GEMM 路由修复,prefill 提速约18%

值得精读,特别是对 kernel 分发逻辑和性能优化感兴趣的工程师。该 PR 通过数据驱动的方式定位并修复了性能回归,展示了如何通过微基准和端到端验证替代盲目调整配置。关注点是:swapAB 的适用范围判断只基于 M,是否应结合 N、K 维度进一步调优。

缺陷修复 重要性 6.38 洞察度 5.00

为包式后端恢复 ModelInfo 缓存,修复启动性能回归

值得精读,尤其关注 inspect_model_cls 的路径解析逻辑变更,以及缓存命中对启动性能的影响。设计上回退到 find_spec 是合理的,但需注意对不同模块布局的兼容性。