Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 18:24 同步状态:空闲 下次计划:2026-08-21 19:24

PR 列表

更多筛选
2026-06-14

#45442 [Core] Simplify MRV2 async output handling

原始 PR · 作者 njhill · 合并时间 2026-06-14 09:15

重构 重要性 6.01 洞察度 6.00

简化 MRV2 异步输出处理逻辑

建议精读并合入。虽然变更量少,但体现了良好的架构清理思路:将输出类型处理的职责从 model runner 移到 executor 层,符合单一职责原则。值得关注的是 `MultiprocExecutor` 中的 `worker_busy_loop` 控制流优化,展示了如何通过消除冗余分支和提前返回简化异常处理。

性能优化 重要性 7.77 洞察度 5.00

SM90 FP8 GEMM 支持奇数 M,性能提升 180~290%

值得精读。本 PR 展示了如何通过 kernel 模板参数交换(swap_ab)来绕过 cutlass 对 M 维度的对齐限制,是一种通用的性能优化技巧。同时代码清理(移除 padding hack)也值得借鉴。建议关注 C++ kernel 中模板参数对布局的调整方式。

2026-06-13

#45536 Fix docs build on `main`

原始 PR · 作者 hmellor · 合并时间 2026-06-13 23:53

缺陷修复 重要性 4.84 洞察度 2.00

修复 docs 构建失败问题

建议快速合并,属于基础设施修复,无需深入审查。

缺陷修复 重要性 7.49 洞察度 5.00

修复 M-RoPE 模型 prompt_embeds 拒绝服务漏洞

建议精读,该 PR 展示了典型的安全修复模式:将硬断言转为优雅处理。代码逻辑清晰,测试覆盖完整,值得作为类似问题的参考。关注点:`_init_mrope_positions` 中的三路分支设计和测试中通过 Mock 和 `object.__new__` 绕过初始化的技巧。

参与讨论