Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42

PR 列表

更多筛选
2026-06-22

#46373 [docs] link security docs from AGENTS

原始 PR · 作者 simon-mo · 合并时间 2026-06-22 21:28

文档 重要性 2.02 洞察度 1.00

AGENTS.md 添加安全文档引导

此 PR 仅作文档补充,无需精读代码。但作为安全治理的基础设施优化,值得维护者确认链接正确性后合并。

#46327 [XPU] update nixl to v1.2.0

原始 PR · 作者 zhenwei-intel · 合并时间 2026-06-22 20:55

基础设施 重要性 3.50 洞察度 2.00

XPU Dockerfile 升级 nixl 至 v1.2.0

建议快速合入。变更清晰、范围小、风险低,属于常规依赖升级。值得关注的是未来 nixl 版本更新是否需同步调整其他硬件平台的 Dockerfile。

#44324 [CPU][RISC-V] Add RVV micro GEMM for WNA16

原始 PR · 作者 wcynb1023 · 合并时间 2026-06-22 20:53

功能 重要性 7.92 洞察度 6.00

为 CPU WNA16 添加 RVV 微 GEMM 内核,加速 2.4-3.2x

值得精读。设计上清晰地分离了 ISA 枚举、微 GEMM 内核、C++ 分发、Python 前端,层次分明。RVV 内核实现中 Mx8 tile 和 K 展开的策略可推广到其他量化场景。代码注释丰富,适合作为为特定 ISA 添加微内核的参考。

缺陷修复 重要性 7.25 洞察度 5.00

禁用 gfx942 上的 TileLang MHC 路径

**建议阅读**:本 PR 是典型的正确性保护修复,代码逻辑清晰,适合作为平台条件编译的参考模式。 **值得关注的设计决策**:采用装饰器函数 `_has_tilelang_mhc` 集中管理平台兼容性逻辑,避免散落在各个 kernel 分支中;区分 CUDA 和 ROCm 平台,并为未来按 kernel 粒度控制预留可能。 **建议跟进**:后续可参考作者在 issue 中的 kernel 级分析,按需重新启用 `mhc_post_tilelang` 和 `hc_head_fused_kernel_tilelang` 在 gfx942 上的使用,以恢复部分性能。

缺陷修复 重要性 6.76 洞察度 6.00

修复异步推测解码 accepted 计数竞态

推荐精读。该 PR 展示了异步推测解码中一个微妙的竞态条件及其修复过程,涉及 GPU D2H 拷贝、input batch 行重排、cudagraph 元数据生命周期等深层机制。对于从事 speculative decoding、cudagraph 或 async scheduling 开发的工程师有重要参考价值。

参与讨论