Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-06-22
性能优化 重要性 8.45 洞察度 6.00

Triton 融合替代 torch.compile 修复 MiniMax 性能回归

值得精读,尤其关注如何用 Triton 手动替代 torch.compile 进行算子融合的方案,可作为类似性能优化案例的参考。

2026-06-21
功能 重要性 8.50 洞察度 6.00

支持 DFlash 混合 KV 页面大小的填充与 reshape

推荐精读的设计决策: - 如何用 `indexes_kv_by_block_stride` 统一两种需要非连续 block stride 的场景(跨层统一布局和填充页面布局)。 - 填充 vs 放大 block size 的权衡选择和实现细节。 - `_reshape_attention_kv_cache` 的 strided view 计算方式,尤其是对 num-blocks-first 布局的适配。 - 测试设计:覆盖 FlashAttention、HND、DiffKV 三种不同 stride order 的后端。

缺陷修复 重要性 9.18 洞察度 7.00

修复 MoRIIO READ 下混合 KV 布局的传输偏移

该 PR 代码质量高,将布局逻辑抽象为独立模块,并通过 `KVCacheSpec` 驱动而非硬编码形状模式。建议阅读 `moriio_layout.py` 中的几何计算逻辑,了解如何支持多种缓存布局的偏移量推导。社区开发者可参考此模式添加新的布局支持。

缺陷修复 重要性 5.14 洞察度 4.00

修复 Mamba 状态缓冲区内存指针溢出

值得精读,尤其关注审核者提出的“统一所有平台”决策。该 PR 展示了如何处理跨平台的内存地址符号性问题,对于理解 vLLM 的 GPU 内存管理有启发意义。

参与讨论