Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 18:24 同步状态:空闲 下次计划:2026-08-21 19:24

PR 列表

更多筛选
2026-07-21

#49231 [CI] Exercise FA3 FP8 attention on SM90

原始 PR · 作者 simon-mo · 合并时间 2026-07-21 10:26

测试 重要性 4.09 洞察度 3.00

启用 H100 上 FA3 FP8 注意力测试覆盖

值得合入,作为测试覆盖补强和小型 dtype 处理学习点。建议关注后续 CI 运行结果,验证 H200 上的实际通过情况。

#47879 Update qutlass cmake for stable abi

原始 PR · 作者 cleonard530 · 合并时间 2026-07-21 09:31

重构 重要性 5.72 洞察度 5.00

更新QuTLASS CMake集成以支持稳定ABI

建议合入。该PR使QuTLASS扩展成为ABI稳定版本,降低了维护成本。但需确认上游提交已稳定且无其他回归。

缺陷修复 重要性 5.57 洞察度 6.00

修复 WSL 平台循环导入导致 import vLLM 失败

此 PR 是紧急 bugfix,修复逻辑简单明确,值得快速合并。测试设计巧妙(伪造 uname 模拟 WSL),可作为类似场景的参考。对于阅读者,核心看点是理解循环导入的触发链。

性能优化 重要性 4.19 洞察度 6.00

修复 AWQ 预处理内核非合并 HBM 访问,提速 2.22x

建议仔细阅读以学习 GPU 内存合并优化模式。评审中 Copilot 对冗余检查和未使用参数的提醒展示了代码审查的价值,值得在其他内核优化中参考。

缺陷修复 重要性 6.62 洞察度 5.00

修复 KV 缓存配置中 per-group 块计数错误

值得合并。改动简洁,测试充分,修复了一个潜伏且可能影响容量评估的 bug。设计上逐组计算块需求是更正确的做法,推荐关注 `UniformTypeKVCacheSpecs` 聚合行为的理解。

参与讨论