Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-07-26
缺陷修复 重要性 4.77 洞察度 3.00

修复 CPU 卸载未对齐滑动窗口断言失败

本 PR 是一次精准的最小修复,展示了如何在不改动分配逻辑的前提下通过修正断言边界解决生产问题。建议关注其边界分析方法和 review 中 orozery 对简洁性的坚持。对于使用 CPU offload 的团队,此修复可直接合入。

功能 重要性 9.36 洞察度 8.00

实现对称 P2P KV 卸载次级层

该 PR 实现了 P2P KV 卸载的完整查找/服务路径,是分布式推理基础设施的关键架构决策。推荐系统架构师和调度模块开发者精读,特别关注 ClientRole 和 ServerRole 的状态机设计、ParentManager 的临时句柄模式、以及聚合查找响应(HIT_PENDING + deadline)的权衡。Review 中关于状态整合、性能扫描和安全攻击向量的讨论值得借鉴。建议在合入后补充安全白名单配置和性能基准测试。

性能优化 重要性 6.41 洞察度 5.00

分离 MM 预处理线程池,消除图像预处理阻塞 tokenization

值得精读的设计变更,性能提升数据扎实。推荐关注 `_mm_executor` 的拆分思路以及如何利用独立线程池消除资源竞争。此外,配置校验的精细化处理也值得借鉴。

#49531 [Perf] DeepSeek-OCR-2 TTFT Optimize

原始 PR · 作者 LiuLi1998 · 合并时间 2026-07-26 13:53

性能优化 重要性 7.60 洞察度 7.00

优化DeepSeek-OCR-2注意力掩码计算,TTFT降46%

值得精读。该PR清晰展示了如何通过分析数据模式(批次不变性)消除冗余CPU→GPU操作,并利用@lru_cache以极小成本实现加速。设计决策中关于缓存key范围的取舍(保留dtype和device)体现了对实际部署场景的考量。

文档 重要性 2.79 洞察度 2.00

Docker 部署页添加编译缓存持久化示例

建议快速合并。该 PR 解决了用户可感知的痛点,文档示例清晰且附带性能数据支撑。对于部署 vLLM 的团队值得关注,有助于优化容器启动时间。

性能优化 重要性 8.60 洞察度 7.00

共享 CPU 区域 MLA KV 去重,减少 TP 复制流量

值得精读和部署。核心决策(推导式布局、写入者选举)设计谨慎,fail-closed 安全;review 中发现的 preemption 数据竞争表明审核质量高。建议关注 #48408 的后续集成以支持更复杂的缓存布局。

参与讨论