Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42

PR 列表

更多筛选
2026-06-04
功能 重要性 8.28 洞察度 6.00

为 InternVL 系列添加 ViT CUDA 图支持

值得精读。PR 展示了如何为 ViT 编码器集成 CUDA 图,包括协议方法实现、测试和文档配套。特别关注接口适配 #41234 的过程,以及如何解决 MIG 环境兼容性问题。

功能 重要性 5.91 洞察度 6.00

切换 LMCache 后端默认使用多进程连接器

建议阅读此 PR,因为它展示了如何将进程内 KV offloading 设计迁移为外部服务器模式。关键设计决策包括:使用多进程分离解耦缓存管理与推理引擎、利用 connection string 默认值简化配置、移除不再需要的配置项以避免用户误解。对于计划集成外部缓存系统的开发者有很好的参考价值。

功能 重要性 9.36 洞察度 7.00

重构推测解码器架构,支持 Gemma4 MTP

建议合并后要求补充 Gemma4 MTP 的 E2E 测试;值得精读 AutoRegressiveSpeculator 的 hooks 设计和 Gemma4Speculator 的 KV 共享实现。

测试 重要性 4.09 洞察度 2.00

修复XPU下GPU模型runner测试跳过条件

此PR是典型的平台兼容性修复,技术价值不高,但保证了CI流水线在XPU上的稳定性。建议快速合并,无需深入审查。感兴趣的读者可留意测试跳过条件的未来调整。

缺陷修复 重要性 5.60 洞察度 4.00

修复 Gemma4 MTP 并发下 block table batch_size 不匹配

建议尽快合并此修复,因为它直接解决了 Gemma4 MTP 在 FlashAttention 后端下的生产阻塞 bug。虽然改动极小,但 root cause 分析清晰,值得其他 speculative decoder 开发者在实现类似 per-group block table 时注意 batch 维度对齐。

参与讨论