Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 19:35 同步状态:空闲 下次计划:2026-08-21 20:35

PR 列表

更多筛选
2026-06-05

#42139 [XPU][MoE] support block_fp8_moe on xpu

原始 PR · 作者 zufangzhu · 合并时间 2026-06-05 08:36

功能 重要性 6.89 洞察度 5.00

XPU 支持 Block FP8 MoE 量化

该 PR 值得快速合入,变更简洁且聚焦。建议关注后续是否添加针对 Block FP8 的专项测试以覆盖更多量化组合。设计上继承现有架构,可读性强。

功能 重要性 6.92 洞察度 4.00

为Rust前端添加language-model-only标志跳过多模态加载

设计简洁,可以安全合并。对于仅使用语言模型的用户,推荐启用该标志以提高启动可靠性。值得关注的是如何在 Rust 和 Python 之间一致地传递参数的模式。

缺陷修复 重要性 4.89 洞察度 4.00

修复 DeepSeek V4 RoPE 缓存在 meta device 上的构造失败

该 PR 是经典的一行 bugfix,虽小但修复了深层 device 一致性问题。值得精读,尤其是理解 `torch.device` 在 meta device 场景下的传播模式。

重构 重要性 6.18 洞察度 6.00

统一 KDA 卷积状态为一个缓存

建议精读。这是一个典型的数据结构统一重构,展示了如何在不改变内核计算逻辑的前提下,通过调整状态分组来适配更通用的架构。对于理解 vLLM 中 Mamba 系列(特别是 GDN/KDA)的缓存设计很有帮助。

功能 重要性 8.83 洞察度 7.00

使用 split_group 替代 new_group 创建分布式子组

值得精读,特别是分布式初始化细节和 split_group 的性能优势。设计上采用环境变量作为 rollback 机制、分离新旧路径的做法值得借鉴。合并后应关注后续启用 PR 的测试结果。

测试 重要性 6.18 洞察度 4.00

扩展 Lightning/AWQ Triton 测试到 XPU

该 PR 是低风险、高收益的平台扩展,值得合并。设计决策(使用 `current_platform` 代替硬编码设备字符串)已被多个历史 PR 采用,是 vLLM 平台抽象层的良好实践。测试团队可参考此模式为其他 Triton 内核添加多平台覆盖。

#44380 [Bugfix] Fix test_cutlass_moe.py

原始 PR · 作者 bnellnm · 合并时间 2026-06-05 02:18

缺陷修复 重要性 5.40 洞察度 3.00

修复 CUTLASS FP8 MoE 测试和 expert_map 传递

值得合入。该 PR 修复了长期失效的测试,并修正了一个潜在的功能缺失。建议在合并后监控 CI 中该测试的通过情况。

参与讨论