为 Rust 前端添加 /abort_requests 端点
值得精读,特别是了解 Rust 前端如何处理请求 ID 映射以及如何扩展管理 API。建议在合并前确保另一个 PR 的映射已到位。
A high-throughput and memory-efficient inference and serving engine for LLMs
为 Rust 前端添加 /abort_requests 端点
值得精读,特别是了解 Rust 前端如何处理请求 ID 映射以及如何扩展管理 API。建议在合并前确保另一个 PR 的映射已到位。
Rust 前端支持 prompt-only completions 路径
此 PR 展示了如何在前端执行请求降级和响应后处理来实现特殊功能,值得负责 Rust 前端或 API 路由实现的开发者精读。设计决策与 Python 行为对齐,保证了兼容性。代码结构清晰,包含充分的测试覆盖。
修复调度器插件测试因 API 变更失败
该 PR 是常规的追踪测试兼容性修复,逻辑简单,无需深入阅读。但值得关注的是,它暴露了 CI 流程中一个问题:PR#44558 的 CI 未运行此测试,反映出测试选择或触发机制可能有盲区。
修复压缩张量 KV 缓存方案验证逻辑
值得快速合并。这是一个典型的单行 bugfix,逻辑清晰,测试验证充分。虽然变更极小,但体现了对输入验证健壮性的重视。不需额外审查。
原始 PR · 作者 gau-nernst · 合并时间 2026-06-17 12:38
MiniMax-M3 支持 FP8 稀疏 GQA
建议精读此 PR,以了解如何在稀疏注意力模型中集成 FP8 KV cache 支持,以及如何将手动 fallback 路径融合到统一 kernel 中。`select_main_impl_cls` 的选择逻辑调整(从 `is_quantized_kv_cache` 到 dtype 精确判断)是一个值得关注的设计决策。
将 NIXL 锁定至 1.2.0 版本
简单且必要的依赖锁定变更,建议尽快合并以恢复 CI 稳定性。
原始 PR · 作者 gau-nernst · 合并时间 2026-06-17 12:07
MiniMax-M3 Triton indexer decode 按 request 批量处理 spec-decode tokens
值得精读,尤其关注 Triton 内核优化模式:利用 constexpr 元数据避免重编译、通过虚拟 batch 批量处理 query tokens、移除冗余计算。设计决策中对无 spec-decode 场景保持兼容的做法也值得借鉴。
原始 PR · 作者 liangel-02 · 合并时间 2026-06-17 11:53
使自定义 mask mod 支持全 CUDA 图捕获
该 PR 展示了如何分步实现复杂兼容,值得关注 vLLM 注意力后端与 CUDA graphs 兼容性设计的读者阅读。设计中在构造函数缓存结果是一个好的模式,避免了运行时重复获取配置。此外,对边界情况的处理(使用 set 检测不一致)也值得借鉴。
参与讨论