消除 pooler 中 GPU->CPU 同步点
值得精读,尤其是理解如何通过将索引和元数据保留在 CPU、异步回传 GPU 来消除同步点。设计决策清晰(显式切片 vs. torch.split),重构思路可推广到其他类似场景。
A high-throughput and memory-efficient inference and serving engine for LLMs
消除 pooler 中 GPU->CPU 同步点
值得精读,尤其是理解如何通过将索引和元数据保留在 CPU、异步回传 GPU 来消除同步点。设计决策清晰(显式切片 vs. torch.split),重构思路可推广到其他类似场景。
为 XPU 平台启用 is_act_and_mul=False 及 RELU2_NO_MUL
值得精读,展示了 vLLM 中为硬件平台添加 MoE 功能支持的典型模式:通过扩展核心层的平台检查和更新后端模块的能力声明。对于从事多平台适配的开发者有参考价值。
原始 PR · 作者 TheEpicDolphin · 合并时间 2026-05-05 08:44
修复 MTP>2 时 DSV4 因缺少注意力元数据重建导致的崩溃
建议精读。该 PR 巧妙解决了 CUDA Graph 静态性与动态 metadata 重建的矛盾,通过标量张量传递步骤信息,并拆分单步生成逻辑,设计思路值得借鉴。同时包含性能基准数据,对理解推测解码性能特性有帮助。
TurboQuant 支持混合模型并修复页面大小对齐
建议 TQ 使用者精读 `config.py` 中的 `get_boundary_skip_layers` 和 `_get_full_attention_layer_indices`,理解混合模型识别机制;如需在新架构上启用 TQ,需对应扩展该函数。平台层面的 LCM 页面大小设计值得参考。
原始 PR · 作者 yewentao256 · 合并时间 2026-05-05 07:37
禁止非 MoE 模型使用外部 DP 模式
建议阅读本 PR 以了解 vLLM 数据并行配置的设计约束。特别关注从运行时修补到启动时验证的决策过程,以及相应的测试和文档配套更新。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-05-05 07:32
修复DeepSeek MLA prefill scale计算错误
值得精读,尤其关注 `get_mla_prefill_scale` 中的模型版本区分逻辑(`compress_ratios` 属性)和 YaRN mscale 的应用方式。后续可考虑将 scale 计算统一到模型配置层,避免重复代码。
原始 PR · 作者 MatthewBonanni · 合并时间 2026-05-05 04:35
文档新增 Non-Causal 列支持
属于纯文档增强,可快速合并。代码中的缩进不一致问题建议在合并前或后续 cleanup PR 中修复。文档描述可采纳机器人建议稍作调整以提升清晰度。
原始 PR · 作者 fxmarty-amd · 合并时间 2026-05-05 04:13
修复 NVFP4 MoE 模拟后端设备属性引用错误
此 PR 是单行 bugfix,逻辑简单直接,但修复了一个实际运行时的阻塞问题。对于关注 NVFP4 量化或 MoE 模拟后端的开发者有一定参考价值,展示了设备属性引用健壮性的重要性。建议合并并提醒相关测试应覆盖模拟后端路径。
参与讨论