#52998 [Distributed] Enable FlashInfer all-reduce by default
原始 PR · 作者 WoosukKwon · 合并时间 2026-08-20 09:17
默认启用 FlashInfer all-reduce 并跳过批不变模式
值得精读,重点关注默认开启带来的性能变化以及批不变模式的兼容性处理。建议运行更多平台和形状的测试以验证鲁棒性。
标签列表
聚合结果
原始 PR · 作者 WoosukKwon · 合并时间 2026-08-20 09:17
默认启用 FlashInfer all-reduce 并跳过批不变模式
值得精读,重点关注默认开启带来的性能变化以及批不变模式的兼容性处理。建议运行更多平台和形状的测试以验证鲁棒性。
修复 DeepEP v2 下 TRTLLM BF16 的 top_k 错位崩溃
值得快速精读:核心修复只有一行,但它点出了一个重要的数据契约问题——同一 topk_ids 在不同调度路径(eager/cudagraph、DeepEP v2 expanded/普通展开)下形状语义不同,kernel 参数必须跟随实际数据布局而非模型配置。测试重构(`_make_experts` 参数化多后端)也值得借鉴,可作为 MoE kernel 测试的统一模式。
Marlin 支持 CT block FP8 的 scale 命名兼容
值得精读。这是一个典型的数据契约兼容修复,展示了如何在共享内核抽象上兼容不同量化框架的 scale 命名差异。重点关注 `_block_scale_name` 的探测逻辑、`process_weights_after_loading` 与原属性名写回的配合,以及测试参数化如何覆盖 auto 与强制 Marlin 两条路径;同时可结合 #52182 与 #52908 理解前向修复与回退方案之间的取舍。
回退 Gemma-4 FA4 FP8 内核支持,恢复 FA3 默认路径
值得精读,尤其是 Gemma-4 模型支持、flash-attention 集成和推测解码方向的开发者。可以关注两点:一是回退选择了删除配置感知接口、改用 set_current_vllm_config 上下文对象,这种避免 API 扩散的做法可复用;二是 _copy_target_kv_scales 连同 FP8 KV scale 共享修复一起被移除,说明该问题在 MRV2 阶段被有意搁置。若团队计划重新引入 FA4,建议先建立覆盖 SM90 FP8 KV 与 MTP 的回归测试基线。
为 CUDA 依赖新增 InstantTensor 包并更新锁文件
该 PR 属于常规依赖维护,值得快速了解,但不建议深入复习。值得关注的是其对未来 InstantTensor 加载器支持的前置意义,可留意后续是否会有相关功能 PR。同时,维护者应确保 InstantTensor 与现有 Torch 版本兼容,并在未来启用加载器时做好充分的测试。
原始 PR · 作者 lucifer1004 · 合并时间 2026-08-19 21:25
SM120 FP8 GEMM 路由修复,prefill 提速约18%
值得精读,特别是对 kernel 分发逻辑和性能优化感兴趣的工程师。该 PR 通过数据驱动的方式定位并修复了性能回归,展示了如何通过微基准和端到端验证替代盲目调整配置。关注点是:swapAB 的适用范围判断只基于 M,是否应结合 N、K 维度进一步调优。
新增 NemotronH_Omni_Reasoning_V3 架构支持并启用 MTP 推测解码
值得快速阅读,改动虽小但涉及模型注册和推测解码的关键路径。关注设计:通过简单映射和条件扩展实现新模型支持,体现了 vLLM 对向后兼容的重视。
原始 PR · 作者 WoosukKwon · 合并时间 2026-08-19 15:13
DSA 模型改为默认走 CUDA 非编译 MRV2 路径
值得精读。这是一个典型的默认路径切换 + 平台分派 PR,建议关注三点:1) `vllm/models/deepseek_v32/__init__.py` 的 CUDA/非 CUDA 导入分派如何与 `registry.py` 解耦并保持类名契约;2) `vllm/config/vllm.py` 中架构集合 + 环境变量自动写入 + `CompilationMode.NONE` 的配置自动决策模式,可作为其他模型默认执行路径的样板;3) capability-gated kernel 与 fallback 的硬件兼容策略。也需注意到其测试主要集中在配置层、真实硬件验证依赖 CI 的代价。