Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-05-28

#43791 Fix early CUDA init

原始 PR · 作者 hmellor · 合并时间 2026-05-28 00:30

缺陷修复 重要性 6.30 洞察度 6.00

修复因 eager import 导致的 CUDA 驱动提前初始化

此 PR 是修复 CI 的关键修复,建议合并。其设计决策(避免在 __init__.py 中导出可能引入副作用的大模块)值得其他模块借鉴。

#43546 [Docs] Fix the duplicate doc icon issue

原始 PR · 作者 chunyang-wen · 合并时间 2026-05-28 00:09

缺陷修复 重要性 4.18 洞察度 2.00

修复文档生成时重复 GitHub 图标问题

可以快速合入。无需精读,但可作为学习 MkDocs 预处理顺序影响的好例子。

2026-05-27

#43745 [misc] Bump cutedsl version to 4.5.2

原始 PR · 作者 zyongye · 合并时间 2026-05-27 23:25

基础设施 重要性 1.70 洞察度 1.00

升级 cutedsl 依赖到 4.5.2

可快速合并。建议在后续 CI 中关注 FA4 相关测试是否通过。

功能 重要性 5.78 洞察度 5.00

Triton W4A16 内核支持 CUDA fallback

值得合并,变更简洁且目的明确。建议在后续 PR 中添加性能日志或文档说明,帮助用户了解 fallback 内核的使用情况。同时可考虑为 TritonW4A16LinearKernel 添加更细粒度的性能基准测试。

#43697 [Docs] Fix MLA prefill backend default docs

原始 PR · 作者 mmangkad · 合并时间 2026-05-27 18:13

文档 重要性 3.60 洞察度 2.00

修正 MLA prefill 后端默认选择文档

建议审阅者确认文档预览内容正确后直接合并。这是一次纯粹的文档修正,没有逻辑和行为变更。

参与讨论