#44484 [MM][CG] Simplify ViT CUDA graph interfaces
原始 PR · 作者 shen-shanshan · 合并时间 2026-06-08 13:57
简化 ViT CUDA Graph 接口默认输入模态
本 PR 为简单的重构清理,值得合并以保持代码整洁。无需精读,可以快速通过 review。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 shen-shanshan · 合并时间 2026-06-08 13:57
简化 ViT CUDA Graph 接口默认输入模态
本 PR 为简单的重构清理,值得合并以保持代码整洁。无需精读,可以快速通过 review。
原始 PR · 作者 majian4work · 合并时间 2026-06-08 13:27
新增 DeepSeek-V4 XPU 注意力解码路径
建议阅读此 PR 以了解在 vLLM 中扩展硬件后端的标准模式:继承共享注意力基类、通过 `current_platform` 分派、将专用内核放入平台子目录。特别关注 Triton 内核中 FP8 反量化和 GPT-J RoPE 的融合实现,以及 `__init__` 中的平台选择策略。对于 review,应注意临时方案(如 `cuda.Event` 替换)的清理计划。
修复 MambaManager 因推测轮次动态变化导致的断言失败
该 PR 修复关键崩溃问题,修改简洁且测试覆盖充分,建议尽快合并。
原始 PR · 作者 taneem-ibrahim · 合并时间 2026-06-08 11:19
为pooler类添加extra_repr()以提升调试性
值得精读,设计模式简单但实用。展示了如何利用 PyTorch 的 extra_repr 钩子以最小成本提升代码可调试性。该模式可推广至其他复杂模块。
修复 FunASR-Nano 初始化崩溃
值得立即合并,属于关键 bug 修复。虽然改动很小,但体现了重要的接口契约问题:当框架新增对公共接口的调用时,需要确保所有实现该接口的模型都覆盖到。建议在文档或社区中提醒模型贡献者注意 `get_language_model()` 的适配。
使Mamba混合内核测试可同时在CUDA和XPU上运行
值得快速浏览,展示了 vLLM 平台层进行跨平台测试适配的推荐模式。如果负责 XPU 或多平台测试,可以精读以复用该模式。PR 作者工作规范,测试结果详尽,提交历史清晰,适合作为测试适配的参考范例。
原始 PR · 作者 LucasWilkinson · 合并时间 2026-06-07 22:53
提取 DSV4 KV 缓存配置中按页大小分层的逻辑为通用辅助函数
建议仔细审查 `_bucket_layers_by_page_size` 的桶构建逻辑,特别是 slot 索引的处理是否与原有 `_get_kv_cache_config_deepseek_v4` 行为完全一致。该 PR 虽小,但作为标准化 KV 缓存布局的关键起点,值得深入阅读以理解后续演进方向。重点关注 `_pool_bytes_per_block` 计算修正如何避免假设不同 page_size 的 slot 数相同。
ROCm 启用 permute_cols op
该 PR 值得快速合入,因为它去除了一个无必要的平台门槛,提升了 ROCm 平台的功能完整性。设计上简单地移除保护宏并正确调整 CMake 配置,可作为平台兼容性治理的优选范例。
参与讨论