Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42

PR 列表

更多筛选
2026-06-08
功能 重要性 9.18 洞察度 6.00

新增 DeepSeek-V4 XPU 注意力解码路径

建议阅读此 PR 以了解在 vLLM 中扩展硬件后端的标准模式:继承共享注意力基类、通过 `current_platform` 分派、将专用内核放入平台子目录。特别关注 Triton 内核中 FP8 反量化和 GPT-J RoPE 的融合实现,以及 `__init__` 中的平台选择策略。对于 review,应注意临时方案(如 `cuda.Event` 替换)的清理计划。

缺陷修复 重要性 6.28 洞察度 5.00

修复 FunASR-Nano 初始化崩溃

值得立即合并,属于关键 bug 修复。虽然改动很小,但体现了重要的接口契约问题:当框架新增对公共接口的调用时,需要确保所有实现该接口的模型都覆盖到。建议在文档或社区中提醒模型贡献者注意 `get_language_model()` 的适配。

测试 重要性 5.34 洞察度 4.00

使Mamba混合内核测试可同时在CUDA和XPU上运行

值得快速浏览,展示了 vLLM 平台层进行跨平台测试适配的推荐模式。如果负责 XPU 或多平台测试,可以精读以复用该模式。PR 作者工作规范,测试结果详尽,提交历史清晰,适合作为测试适配的参考范例。

2026-06-07
重构 重要性 7.55 洞察度 5.00

提取 DSV4 KV 缓存配置中按页大小分层的逻辑为通用辅助函数

建议仔细审查 `_bucket_layers_by_page_size` 的桶构建逻辑,特别是 slot 索引的处理是否与原有 `_get_kv_cache_config_deepseek_v4` 行为完全一致。该 PR 虽小,但作为标准化 KV 缓存布局的关键起点,值得深入阅读以理解后续演进方向。重点关注 `_pool_bytes_per_block` 计算修正如何避免假设不同 page_size 的 slot 数相同。

#44674 [ROCm][Kernel] Enable permute_cols for ROCm

原始 PR · 作者 charlifu · 合并时间 2026-06-07 17:50

重构 重要性 4.54 洞察度 5.00

ROCm 启用 permute_cols op

该 PR 值得快速合入,因为它去除了一个无必要的平台门槛,提升了 ROCm 平台的功能完整性。设计上简单地移除保护宏并正确调整 CMake 配置,可作为平台兼容性治理的优选范例。

参与讨论