Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 14:34 同步状态:空闲 下次计划:2026-08-20 15:34
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-07-17

#48143 [Perf] Optimize `clamp` to `clamp_`

原始 PR · 作者 yewentao256 · 合并时间 2026-07-17 06:41

性能优化 重要性 6.69 洞察度 4.00

将 `clamp` 替换为 `clamp_` 以减少 GPU 内存分配

建议优先验证 `sparse_mla.py` 中 `clamp_` 的安全性,确认 `block_table_tensor` 是否被其他路径共享。如果风险不可接受,应回退为 `.clamp()`。其他文件的变更相对安全,可以保留。此 PR 不宜直接适用于要求高度稳定性的场景。

新增ROCm AITER QK Norm+RoPE+KV Cache融合pass

值得精读,特别是对 ROCm 平台推理优化和 TorchInductor pattern matcher 感兴趣的开发者。该 PR 展示了如何安全地将多次 kernel launch 融合为单个自定义 op,并处理了不同 attention 后端的布局差异。

功能 重要性 8.90 洞察度 6.00

为 Gemma4-12B 添加 DSpark 推测解码支持,基于 DFlash/Qwen 栈薄层复用实现。

值得精读。该 PR 是 vLLM 中“薄子类复用”模式的典型案例:将架构差异隔离在小职责类中,最大化复用现有推测解码栈。设计文档清晰,性能数据翔实。建议关注 `Gemma4DSparkAttention._kv_proj` 的 `k_eq_v` 共享投影实现、`Gemma4DSparkModel._build_fused_kv_buffers` 的融合 KV 预计算机制,以及 config 自动检测中 Gemma4 分支的处理。

功能 重要性 9.00 洞察度 6.00

新增 nvfp4_per_token 在线 MoE 量化方案

该 PR 值得精读,因为它展示了如何将一个新的硬件特定量化方案集成到 vLLM 的在线量化框架中,包括配置注册、方法分派、权重处理与内核对接。设计清晰,可作为未来扩展的参考。关注其后续的准确性基准和性能优化。

缺陷修复 重要性 6.24 洞察度 6.00

修复 Humming WNA4Int/WNA8Int 激活量化调度 bug

值得精读。虽然改动量小,但揭示了 Humming 量化路径中 schema 分发设计的隐蔽 bug,对理解量化配置的工厂方法与继承路由有参考价值。建议在后续 PR 中补充 vllm 内的单元测试,覆盖 `BaseInputSchema.from_config` 的分发逻辑。

#48869 [Model] Add Inkling MTP=1 support [3/N]

原始 PR · 作者 WoosukKwon · 合并时间 2026-07-17 04:27

功能 重要性 9.18 洞察度 6.00

为 Inkling 模型添加 MTP=1 推测解码支持

建议精读此 PR,了解 vLLM 如何为新模型集成 speculative decoding 支持,尤其是配置覆写、权重共享和融合核函数的设计模式。

缺陷修复 重要性 7.36 洞察度 6.00

修复 MoRIIO RDMA 发送队列满时重试读请求

值得精读,尤其关注瞬态错误重试策略和 ACK 缓冲机制的设计权衡。`_is_sq_full_status` 的实现依赖字符串匹配,建议未来考虑更健壮的检测方式(如 mori 库的错误码)。

参与讨论