Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-07-22
重构 重要性 8.14 洞察度 5.00

将 PyNvVideoCodec 内存预留逻辑移出 GPU Worker

值得精读,展示了如何通过重构减少跨模块耦合。`reserve_mm_ipc_gpu_memory` 函数的独立也便于后续为其他加速后端(如 ROCm、Intel GPU)实现类似机制。

缺陷修复 重要性 8.41 洞察度 6.00

作用域化 MTP 完整性检查,修复分桶权重更新误报

此 PR 修复了一个阻塞性问题,设计思路清晰(使用 ContextVar 实现作用域控制),代码质量高。建议所有涉及 speculative decoding MTP 模型的开发者精读,尤其是 ContextVar 的使用方式和模型端条件检查的插入点。

#49356 [CI][Bugfix] Fix and wire streaming-input tests

原始 PR · 作者 njhill · 合并时间 2026-07-22 08:35

缺陷修复 重要性 4.53 洞察度 4.00

修复并接入流式输入测试套件到 CI

建议合并。该 PR 修正了测试套件与代码的同步问题,并恢复了 CI 覆盖,是维护健康测试基础设施的必要步骤。值得关注的是调度器中 `skipped_waiting` 队列的使用,反映了流式输入会话的生命周期管理设计。

#49344 [Misc] Fix terminal output logo coloring

原始 PR · 作者 njhill · 合并时间 2026-07-22 08:21

其他 重要性 4.84 洞察度 3.00

修正终端 logo 颜色为默认粗体

简单直接的 UI 微调,无需深入审查。可作为前端或 CLI 颜色调整的参考案例。

#48979 skip cudagraph/DP padding in topk

原始 PR · 作者 gnovack · 合并时间 2026-07-22 06:20

性能优化 重要性 7.53 洞察度 5.00

将 padding 跳过逻辑下放到 topk kernel,提升 MoE 性能

值得精读。此 PR 展示了如何将 GPU 辅助逻辑从 Python 层层下推至 CUDA kernel,减少 kernel launch 开销,是典型的 GPU 优化手法。同时也说明了环境变量默认行为改变时的兼容性考量。建议关注其关联 PR #49395、#46428 以完整理解 padding 跳过功能的演进。

参与讨论