Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 18:24 同步状态:空闲 下次计划:2026-08-21 19:24

PR 列表

更多筛选
2026-06-17

#44382 [Rust Frontend] Add /abort_requests endpoint

原始 PR · 作者 sahilsGit · 合并时间 2026-06-17 14:40

功能 重要性 7.72 洞察度 5.00

为 Rust 前端添加 /abort_requests 端点

值得精读,特别是了解 Rust 前端如何处理请求 ID 映射以及如何扩展管理 API。建议在合并前确保另一个 PR 的映射已到位。

功能 重要性 8.56 洞察度 5.00

Rust 前端支持 prompt-only completions 路径

此 PR 展示了如何在前端执行请求降级和响应后处理来实现特殊功能,值得负责 Rust 前端或 API 路由实现的开发者精读。设计决策与 Python 行为对齐,保证了兼容性。代码结构清晰,包含充分的测试覆盖。

#45897 [BugFix][CI] Fix scheduler plugin test

原始 PR · 作者 njhill · 合并时间 2026-06-17 14:30

缺陷修复 重要性 3.82 洞察度 2.00

修复调度器插件测试因 API 变更失败

该 PR 是常规的追踪测试兼容性修复,逻辑简单,无需深入阅读。但值得关注的是,它暴露了 CI 流程中一个问题:PR#44558 的 CI 未运行此测试,反映出测试选择或触发机制可能有盲区。

#45744 [M3] Enable FP8 sparse GQA

原始 PR · 作者 gau-nernst · 合并时间 2026-06-17 12:38

功能 重要性 8.36 洞察度 6.00

MiniMax-M3 支持 FP8 稀疏 GQA

建议精读此 PR,以了解如何在稀疏注意力模型中集成 FP8 KV cache 支持,以及如何将手动 fallback 路径融合到统一 kernel 中。`select_main_impl_cls` 的选择逻辑调整(从 `is_quantized_kv_cache` 到 dtype 精确判断)是一个值得关注的设计决策。

#45843 [CI][NIXL] Pin NIXL to 1.2.0

原始 PR · 作者 itayalroy · 合并时间 2026-06-17 12:29

基础设施 重要性 2.23 洞察度 2.00

将 NIXL 锁定至 1.2.0 版本

简单且必要的依赖锁定变更,建议尽快合并以恢复 CI 稳定性。

性能优化 重要性 6.21 洞察度 7.00

MiniMax-M3 Triton indexer decode 按 request 批量处理 spec-decode tokens

值得精读,尤其关注 Triton 内核优化模式:利用 constexpr 元数据避免重编译、通过虚拟 batch 批量处理 query tokens、移除冗余计算。设计决策中对无 spec-decode 场景保持兼容的做法也值得借鉴。

功能 重要性 6.93 洞察度 5.00

使自定义 mask mod 支持全 CUDA 图捕获

该 PR 展示了如何分步实现复杂兼容,值得关注 vLLM 注意力后端与 CUDA graphs 兼容性设计的读者阅读。设计中在构造函数缓存结果是一个好的模式,避免了运行时重复获取配置。此外,对边界情况的处理(使用 set 检测不一致)也值得借鉴。

参与讨论