修复 Nemotron 模型精度下降问题
值得立即合并(已合并)。对于维护 MoE 模型的开发者,建议将 `FusedMoE` 中类似的一处缩放逻辑写成更清晰的注释或提取为辅助函数,防止未来再次引入双重缩放。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复 Nemotron 模型精度下降问题
值得立即合并(已合并)。对于维护 MoE 模型的开发者,建议将 `FusedMoE` 中类似的一处缩放逻辑写成更清晰的注释或提取为辅助函数,防止未来再次引入双重缩放。
为混合缓存实现 Marconi 式共享前缀准入策略,提升 Qwen 等模型缓存命中率
值得精读。该 PR 展示了如何在不修改 kernel 的情况下利用现有缓存机制实现高级缓存准入策略,设计思路可推广到其他 hybrid attention 模型。
修复 MNNVL one-sided 测试 workspace 不足
此 PR 为一个测试 bugfix,代码简单,对理解 FlashInfer one-sided 机制有一定参考价值,但无需深度精读。
原始 PR · 作者 juliendenize · 合并时间 2026-06-10 23:48
扩展 CI 通知路径,覆盖 Mistral 全系模型
该 PR 属于基础设施配置调整,审核简单,无技术争议。值得关注的是正则表达式统一采用非捕获组 `(?:...)`,符合最佳实践。建议在后续扩展类似规则时保持此风格。
原始 PR · 作者 benchislett · 合并时间 2026-06-10 23:47
在 MRV2 中实现 DFlash 投机解码,支持 cudagraph
该 PR 值得精读,特别是对实现自定义投机解码器或 CUDA Graph 管理器有参考价值。关键设计决策包括:如何通过基类复用减少重复代码、如何为多查询 per-req 元数据构建注意力符号、以及如何动态切换因果/非因果注意力。建议关注 `_generate_draft` 中的上下文 KV 预计算与采样逻辑。
修复 DeepSeek V4 MTP prefix 缺失问题
建议合入。修复目标明确、改动量极小、风险低,且已获 maintainer 批准。对于关注 DeepSeek V4 模型量化部署的团队,值得了解该修复以正确配置 compressed-tensors 的 ignore/target 规则。
修复 AOT 编译缓存冲突,调整 normalize_value 分支顺序
值得精读。虽然改动极小(仅 12 行源码变更),但揭示了 Transformers 5.x 的 dataclass 变更与 AOT 编译缓存键生成之间的深层交互,对理解 vLLM 的编译缓存机制和依赖兼容性问题有参考价值。
原始 PR · 作者 divakar-amd · 合并时间 2026-06-10 23:04
跳过 conch kernel 处理 g_idx 重排
小而精准的 bugfix,值得合并。对于全量量化模型用户,避免潜在无声错误。
参与讨论