Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 14:34 同步状态:空闲 下次计划:2026-08-20 15:34

PR 列表

更多筛选
2026-07-17

#48884 [Model] Add Inkling LoRA support [4/N]

原始 PR · 作者 WoosukKwon · 合并时间 2026-07-17 09:52

功能 重要性 8.94 洞察度 6.00

为 Inkling 模型添加完整的 LoRA 适配支持,涵盖注意力、MoE 及 lm_head

值得精读。该 PR 展示了在复杂 MoE 架构(共享 sink expert、共享-outer 布局、muP 缩放)中集成 LoRA 的系统性方法,设计决策(如条件选择线性层、检测包装器分流、共享 expert 维为 1 的存储模型)有参考价值。建议关注 InklingSinkExpertsLinear 的 _gamma_expand 实现和 _lora_forward 的 muP 合成逻辑。由于缺少真实适配器评估,在实际部署前应进行充分测试。

性能优化 重要性 8.74 洞察度 7.00

为 M3 长上下文 decode 添加 CuteDSL indexer 内核,支持 FP8 和 BF16

该 PR 值得精读,尤其是 CuteDSL kernel 设计思路(TMA+mma.sync 对比 tcgen05 的权衡)以及 fallback 策略。合并后无已知回归,但建议关注后续其他 CuteDSL 模块是否顺利迁移至 `mma_sync` 接口。

缺陷修复 重要性 8.26 洞察度 6.00

修复fp8_ds_mla dense prefill的越界和gather问题

建议精读`flashmla_sparse.py`中metadata重构和`mla_attention.py`中prefill路径切换的设计,理解如何将decode-only metadata与dense prefill解耦。对有FP8 sparse attention需求的团队,此PR提供了可参考的修复模式。

#48143 [Perf] Optimize `clamp` to `clamp_`

原始 PR · 作者 yewentao256 · 合并时间 2026-07-17 06:41

性能优化 重要性 6.69 洞察度 4.00

将 `clamp` 替换为 `clamp_` 以减少 GPU 内存分配

建议优先验证 `sparse_mla.py` 中 `clamp_` 的安全性,确认 `block_table_tensor` 是否被其他路径共享。如果风险不可接受,应回退为 `.clamp()`。其他文件的变更相对安全,可以保留。此 PR 不宜直接适用于要求高度稳定性的场景。

新增ROCm AITER QK Norm+RoPE+KV Cache融合pass

值得精读,特别是对 ROCm 平台推理优化和 TorchInductor pattern matcher 感兴趣的开发者。该 PR 展示了如何安全地将多次 kernel launch 融合为单个自定义 op,并处理了不同 attention 后端的布局差异。

功能 重要性 8.90 洞察度 6.00

为 Gemma4-12B 添加 DSpark 推测解码支持,基于 DFlash/Qwen 栈薄层复用实现。

值得精读。该 PR 是 vLLM 中“薄子类复用”模式的典型案例:将架构差异隔离在小职责类中,最大化复用现有推测解码栈。设计文档清晰,性能数据翔实。建议关注 `Gemma4DSparkAttention._kv_proj` 的 `k_eq_v` 共享投影实现、`Gemma4DSparkModel._build_fused_kv_buffers` 的融合 KV 预计算机制,以及 config 自动检测中 Gemma4 分支的处理。

参与讨论