Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15

PR 列表

更多筛选
2026-06-21
缺陷修复 重要性 9.18 洞察度 7.00

修复 MoRIIO READ 下混合 KV 布局的传输偏移

该 PR 代码质量高,将布局逻辑抽象为独立模块,并通过 `KVCacheSpec` 驱动而非硬编码形状模式。建议阅读 `moriio_layout.py` 中的几何计算逻辑,了解如何支持多种缓存布局的偏移量推导。社区开发者可参考此模式添加新的布局支持。

缺陷修复 重要性 5.14 洞察度 4.00

修复 Mamba 状态缓冲区内存指针溢出

值得精读,尤其关注审核者提出的“统一所有平台”决策。该 PR 展示了如何处理跨平台的内存地址符号性问题,对于理解 vLLM 的 GPU 内存管理有启发意义。

#46254 [Bugfix] Fix NVFP4/OCP MX MoE emulation

原始 PR · 作者 mawong-amd · 合并时间 2026-06-21 12:13

缺陷修复 重要性 6.91 洞察度 6.00

修复NVFP4/OCP MX MoE模拟双重量化问题

该PR值得关注,因为它揭示了PR #42120 引入的隐蔽bug,以及review过程中对scale选取逻辑的深入讨论。建议合并并密切跟踪相关的OCP MX修复PR #46142。

重构 重要性 7.77 洞察度 5.00

确保异步 H2D 复制前内存固定

值得精读,特别是 `async_tensor_h2d` 的新实现和内存固定策略的统一,对于理解 vLLM 的异步传输方式有帮助。

参与讨论