Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 19:35 同步状态:空闲 下次计划:2026-08-21 20:35

PR 列表

更多筛选
2026-06-11
缺陷修复 重要性 6.21 洞察度 5.00

修复 Nemotron 模型精度下降问题

值得立即合并(已合并)。对于维护 MoE 模型的开发者,建议将 `FusedMoE` 中类似的一处缩放逻辑写成更清晰的注释或提取为辅助函数,防止未来再次引入双重缩放。

功能 重要性 6.68 洞察度 5.00

为混合缓存实现 Marconi 式共享前缀准入策略,提升 Qwen 等模型缓存命中率

值得精读。该 PR 展示了如何在不修改 kernel 的情况下利用现有缓存机制实现高级缓存准入策略,设计思路可推广到其他 hybrid attention 模型。

2026-06-10
基础设施 重要性 2.83 洞察度 2.00

扩展 CI 通知路径,覆盖 Mistral 全系模型

该 PR 属于基础设施配置调整,审核简单,无技术争议。值得关注的是正则表达式统一采用非捕获组 `(?:...)`,符合最佳实践。建议在后续扩展类似规则时保持此风格。

#44586 [MRV2][Spec Decode] DFlash

原始 PR · 作者 benchislett · 合并时间 2026-06-10 23:47

功能 重要性 9.18 洞察度 6.00

在 MRV2 中实现 DFlash 投机解码,支持 cudagraph

该 PR 值得精读,特别是对实现自定义投机解码器或 CUDA Graph 管理器有参考价值。关键设计决策包括:如何通过基类复用减少重复代码、如何为多查询 per-req 元数据构建注意力符号、以及如何动态切换因果/非因果注意力。建议关注 `_generate_draft` 中的上下文 KV 预计算与采样逻辑。

#44821 fix: prefix DeepSeek V4 MTP projections

原始 PR · 作者 he-yufeng · 合并时间 2026-06-10 23:47

缺陷修复 重要性 5.40 洞察度 3.00

修复 DeepSeek V4 MTP prefix 缺失问题

建议合入。修复目标明确、改动量极小、风险低,且已获 maintainer 批准。对于关注 DeepSeek V4 模型量化部署的团队,值得了解该修复以正确配置 compressed-tensors 的 ignore/target 规则。

缺陷修复 重要性 6.40 洞察度 6.00

修复 AOT 编译缓存冲突,调整 normalize_value 分支顺序

值得精读。虽然改动极小(仅 12 行源码变更),但揭示了 Transformers 5.x 的 dataclass 变更与 AOT 编译缓存键生成之间的深层交互,对理解 vLLM 的编译缓存机制和依赖兼容性问题有参考价值。

参与讨论