Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 20:44 同步状态:空闲 下次计划:2026-08-21 21:44

PR 列表

更多筛选
2026-06-22
缺陷修复 重要性 7.25 洞察度 5.00

禁用 gfx942 上的 TileLang MHC 路径

**建议阅读**:本 PR 是典型的正确性保护修复,代码逻辑清晰,适合作为平台条件编译的参考模式。 **值得关注的设计决策**:采用装饰器函数 `_has_tilelang_mhc` 集中管理平台兼容性逻辑,避免散落在各个 kernel 分支中;区分 CUDA 和 ROCm 平台,并为未来按 kernel 粒度控制预留可能。 **建议跟进**:后续可参考作者在 issue 中的 kernel 级分析,按需重新启用 `mhc_post_tilelang` 和 `hc_head_fused_kernel_tilelang` 在 gfx942 上的使用,以恢复部分性能。

缺陷修复 重要性 6.76 洞察度 6.00

修复异步推测解码 accepted 计数竞态

推荐精读。该 PR 展示了异步推测解码中一个微妙的竞态条件及其修复过程,涉及 GPU D2H 拷贝、input batch 行重排、cudagraph 元数据生命周期等深层机制。对于从事 speculative decoding、cudagraph 或 async scheduling 开发的工程师有重要参考价值。

#46352 Temporarily skip M3 on CI

原始 PR · 作者 ywang96 · 合并时间 2026-06-22 16:35

缺陷修复 重要性 3.54 洞察度 2.00

临时跳过 CI 上的 M3 模型测试

该 PR 属于临时性 CI 修复,技术价值低。但如果负责模型集成或 CI 维护,可关注后续修复 NVIDIA 依赖的正确 PR。

#45940 [Doc] Update MiniMax-M3

原始 PR · 作者 jeejeelee · 合并时间 2026-06-22 16:23

文档 重要性 2.90 洞察度 2.00

更新 MiniMax-M3 文档与测试注册

该 PR 为简单文档维护,无需精读。可作为模型文档同步的参考示例。

功能 重要性 7.92 洞察度 5.00

Rust 前端支持 thinking_token_budget 参数,实现与 Python 前端对等

## 建议 - 该 PR 值得精读,特别是 `normalize_thinking_token_budget` 函数的设计(与 Python 逻辑紧密对齐)以及三个转换层统一透传模式。它展示了 Rust 前端如何通过降层(lowering)集中处理参数验证,保持代码整洁。 - 关注后续跟着的推理解析器传递配套 PR,以完全解决 managed-engine 模式下的功能限制。 - 代码审查中应关注字段解构顺序的脆弱性,但当前设计合理。

参与讨论