Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 18:24 同步状态:空闲 下次计划:2026-08-21 19:24

PR 列表

更多筛选
2026-06-25
性能优化 重要性 6.96 洞察度 7.00

fused_moe_kernel 添加 swap AB 优化

该 PR 是值得精读的内核级优化,展示了如何通过调整矩阵乘法顺序利用 WGMMA 指令。建议关注 `enable_swap_ab` 的硬件条件,待 Blackwell 等新架构验证后应放宽限制。

性能优化 重要性 6.28 洞察度 5.00

并行化 Mooncake KV 加载接收线程

该 PR 设计清晰,变更范围小,风险低,值得合并。建议读者关注:共享队列的设计如何实现负载均衡,以及完成结果汇聚的线程安全处理。对于部署 Mooncake 的用户,建议实测不同线程数下的性能差异。

功能 重要性 5.12 洞察度 5.00

FlashInfer MXINT4 MoE 后端支持 gated SiLU 激活

**建议精读**(约 2 分钟)。该 PR 虽小但值得关注以下设计点:1) 如何通过 `_supports_activation` 等静态方法实现后端选择能力声明;2) 纯元数据修复与 kernel 无关的优化策略;3) 测试文件中针对静态方法的单元测试写法。

#46101 [Bugfix] Normalize slashes in Helion GPU names

原始 PR · 作者 cyq1017 · 合并时间 2026-06-25 07:22

缺陷修复 重要性 4.71 洞察度 3.00

修复 Helion GPU 名称中的斜杠未归一化问题

该 PR 属于小范围 bugfix,变更简洁,测试覆盖了关键路径。建议快速合并。对于审核者,可关注正则表达式是否需引入 `regex` 库(与标准库 `re` 的差异)以及未来是否需支持更多 Unicode 分隔符。

参与讨论