#41759 [MM][Perf][CG] Support ViT full CUDA graph for InternVL
原始 PR · 作者 oguzhankir · 合并时间 2026-06-04 10:24
为 InternVL 系列添加 ViT CUDA 图支持
值得精读。PR 展示了如何为 ViT 编码器集成 CUDA 图,包括协议方法实现、测试和文档配套。特别关注接口适配 #41234 的过程,以及如何解决 MIG 环境兼容性问题。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 oguzhankir · 合并时间 2026-06-04 10:24
为 InternVL 系列添加 ViT CUDA 图支持
值得精读。PR 展示了如何为 ViT 编码器集成 CUDA 图,包括协议方法实现、测试和文档配套。特别关注接口适配 #41234 的过程,以及如何解决 MIG 环境兼容性问题。
原始 PR · 作者 maobaolong · 合并时间 2026-06-04 10:23
切换 LMCache 后端默认使用多进程连接器
建议阅读此 PR,因为它展示了如何将进程内 KV offloading 设计迁移为外部服务器模式。关键设计决策包括:使用多进程分离解耦缓存管理与推理引擎、利用 connection string 默认值简化配置、移除不再需要的配置项以避免用户误解。对于计划集成外部缓存系统的开发者有很好的参考价值。
原始 PR · 作者 wanghenshui · 合并时间 2026-06-04 10:22
修复Pooling端点LoRA名称匹配后404错误
该 PR 属于高信号的小型 bugfix,值得精读其修复模式和测试设计,特别是如何构造 PoolingServingBase 的测试替身。
原始 PR · 作者 TheEpicDolphin · 合并时间 2026-06-04 08:51
重构推测解码器架构,支持 Gemma4 MTP
建议合并后要求补充 Gemma4 MTP 的 E2E 测试;值得精读 AutoRegressiveSpeculator 的 hooks 设计和 Gemma4Speculator 的 KV 共享实现。
修复XPU下GPU模型runner测试跳过条件
此PR是典型的平台兼容性修复,技术价值不高,但保证了CI流水线在XPU上的稳定性。建议快速合并,无需深入审查。感兴趣的读者可留意测试跳过条件的未来调整。
修复 Gemma4 MTP 并发下 block table batch_size 不匹配
建议尽快合并此修复,因为它直接解决了 Gemma4 MTP 在 FlashAttention 后端下的生产阻塞 bug。虽然改动极小,但 root cause 分析清晰,值得其他 speculative decoder 开发者在实现类似 per-group block table 时注意 batch 维度对齐。
原始 PR · 作者 dependabot[bot] · 合并时间 2026-06-04 05:14
Bump actions/stale 到 v10.3.0
该 PR 为常规依赖升级,无需特别关注。
原始 PR · 作者 WoosukKwon · 合并时间 2026-06-04 05:06
移除 FlashInfer 版本检查
可以快速合并。这是一个干净的清理 PR,适合作为审查培训的简单案例。
参与讨论