Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-05-05
性能优化 重要性 7.02 洞察度 6.00

消除 pooler 中 GPU->CPU 同步点

值得精读,尤其是理解如何通过将索引和元数据保留在 CPU、异步回传 GPU 来消除同步点。设计决策清晰(显式切片 vs. torch.split),重构思路可推广到其他类似场景。

#37481 [XPU] enable is_act_and_mul for xpu

原始 PR · 作者 xuechendi · 合并时间 2026-05-05 09:07

功能 重要性 5.72 洞察度 4.00

为 XPU 平台启用 is_act_and_mul=False 及 RELU2_NO_MUL

值得精读,展示了 vLLM 中为硬件平台添加 MoE 功能支持的典型模式:通过扩展核心层的平台检查和更新后端模块的能力声明。对于从事多平台适配的开发者有参考价值。

缺陷修复 重要性 8.08 洞察度 7.00

修复 MTP>2 时 DSV4 因缺少注意力元数据重建导致的崩溃

建议精读。该 PR 巧妙解决了 CUDA Graph 静态性与动态 metadata 重建的矛盾,通过标量张量传递步骤信息,并拆分单步生成逻辑,设计思路值得借鉴。同时包含性能基准数据,对理解推测解码性能特性有帮助。

功能 重要性 8.49 洞察度 6.50

TurboQuant 支持混合模型并修复页面大小对齐

建议 TQ 使用者精读 `config.py` 中的 `get_boundary_skip_layers` 和 `_get_full_attention_layer_indices`,理解混合模型识别机制;如需在新架构上启用 TQ,需对应扩展该函数。平台层面的 LCM 页面大小设计值得参考。

缺陷修复 重要性 7.13 洞察度 5.00

修复DeepSeek MLA prefill scale计算错误

值得精读,尤其关注 `get_mla_prefill_scale` 中的模型版本区分逻辑(`compress_ratios` 属性)和 YaRN mscale 的应用方式。后续可考虑将 scale 计算统一到模型配置层,避免重复代码。

文档 重要性 4.18 洞察度 3.00

文档新增 Non-Causal 列支持

属于纯文档增强,可快速合并。代码中的缩进不一致问题建议在合并前或后续 cleanup PR 中修复。文档描述可采纳机器人建议稍作调整以提升清晰度。

缺陷修复 重要性 5.24 洞察度 3.00

修复 NVFP4 MoE 模拟后端设备属性引用错误

此 PR 是单行 bugfix,逻辑简单直接,但修复了一个实际运行时的阻塞问题。对于关注 NVFP4 量化或 MoE 模拟后端的开发者有一定参考价值,展示了设备属性引用健壮性的重要性。建议合并并提醒相关测试应覆盖模拟后端路径。

参与讨论