Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 21:57 同步状态:空闲 下次计划:2026-08-21 22:57

PR 列表

更多筛选
2026-05-25
功能 重要性 8.22 洞察度 6.00

融合 RMSNorm 的 MHC pre 内核与 DeepSeek V4 MoE 重构

值得精读,尤其关注 TileLang 内核如何实现算子融合,以及高层模型如何配合 kernel 接口传递额外参数。该 PR 展示了从 kernel 到模型层的完整融合优化链路。

功能 重要性 9.18 洞察度 6.00

新增纯 Python 文件系统 KV 二级卸载层

推荐精读 DualQueueThreadPool 和 JobState 的完成追踪设计,以及 FileSystemTierManager 对 SecondaryTierManager 接口的实现。合并后可在文档中添加 fs_python 配置说明。

性能优化 重要性 9.00 洞察度 6.00

为 Mamba SSU 内核添加自动调优框架与预配置,性能提升最高 1.6x

该 PR 值得精读,尤其是如何将硬编码调优参数优雅地替换为数据驱动的配置系统,包括配置生成、缓存、环境变量覆盖、fallback 和测试策略。设计模式可复用至其他 kernel 的调优。

2026-05-24

#43385 [ROCm] [DSv4] [Perf] Support DeepSeek v4 MTP

原始 PR · 作者 tjtanaa · 合并时间 2026-05-24 18:43

功能 重要性 9.18 洞察度 6.00

为 DeepSeek V4 在 ROCm 上添加 MTP 推测解码支持

值得精读,特别是 MTP 实现(`mtp.py`)和稀疏注意力 prefill 优化(`rocm.py` 中的 `combine_topk_swa_indices_kernel`)。这些设计展示了如何在 vLLM 架构中为特定硬件定制模型和算子,对理解 vLLM 的推测解码和注意力机制实现有较高参考价值。

缺陷修复 重要性 6.99 洞察度 6.00

修复无效输入逃逸为 500,统一返回 400 错误

值得精读。该 PR 展示了如何在 post-Pydantic 阶段捕获验证错误并映射到合适 HTTP 状态码,涉及 catch-all vs local exception handling 的设计权衡,对入口层开发者有参考价值。

#43142 [kv_offload]: Add DSv4 support

原始 PR · 作者 orozery · 合并时间 2026-05-24 16:10

功能 重要性 7.65 洞察度 5.00

为 offloading 连接器添加 DeepSeek V4 支持

本 PR 值得精读,特别是 `_alignment_block_count` 函数的实现,它展示了如何利用模型结构对齐特性降低 offloading 开销。同时,worker 中的空张量过滤和未填充页面大小修复也是重要的兼容性改进。

缺陷修复 重要性 7.27 洞察度 5.00

修复MooncakeStore全命中时块对齐问题

对于使用MooncakeStore的团队,此PR值得精读以理解块对齐的设计取舍和配置清理策略;对于其他开发者,可作为KV Connector调度器维护的参考案例。

参与讨论