XPU 支持 Block FP8 MoE 量化
该 PR 值得快速合入,变更简洁且聚焦。建议关注后续是否添加针对 Block FP8 的专项测试以覆盖更多量化组合。设计上继承现有架构,可读性强。
A high-throughput and memory-efficient inference and serving engine for LLMs
XPU 支持 Block FP8 MoE 量化
该 PR 值得快速合入,变更简洁且聚焦。建议关注后续是否添加针对 Block FP8 的专项测试以覆盖更多量化组合。设计上继承现有架构,可读性强。
为Rust前端添加language-model-only标志跳过多模态加载
设计简洁,可以安全合并。对于仅使用语言模型的用户,推荐启用该标志以提高启动可靠性。值得关注的是如何在 Rust 和 Python 之间一致地传递参数的模式。
原始 PR · 作者 galletas1712 · 合并时间 2026-06-05 06:30
修复 DeepSeek V4 RoPE 缓存在 meta device 上的构造失败
该 PR 是经典的一行 bugfix,虽小但修复了深层 device 一致性问题。值得精读,尤其是理解 `torch.device` 在 meta device 场景下的传播模式。
统一 KDA 卷积状态为一个缓存
建议精读。这是一个典型的数据结构统一重构,展示了如何在不改变内核计算逻辑的前提下,通过调整状态分组来适配更通用的架构。对于理解 vLLM 中 Mamba 系列(特别是 GDN/KDA)的缓存设计很有帮助。
原始 PR · 作者 yewentao256 · 合并时间 2026-06-05 02:36
优化关闭日志,统一格式并增加上下文信息
值得精读,展示了如何系统性地改进大规模分布式系统的关机可观测性。关注的几点:日志前缀约定、级别权衡、上下文的添加时机。
原始 PR · 作者 tushar00jain · 合并时间 2026-06-05 02:36
使用 split_group 替代 new_group 创建分布式子组
值得精读,特别是分布式初始化细节和 split_group 的性能优势。设计上采用环境变量作为 rollback 机制、分离新旧路径的做法值得借鉴。合并后应关注后续启用 PR 的测试结果。
扩展 Lightning/AWQ Triton 测试到 XPU
该 PR 是低风险、高收益的平台扩展,值得合并。设计决策(使用 `current_platform` 代替硬编码设备字符串)已被多个历史 PR 采用,是 vLLM 平台抽象层的良好实践。测试团队可参考此模式为其他 Triton 内核添加多平台覆盖。
修复 CUTLASS FP8 MoE 测试和 expert_map 传递
值得合入。该 PR 修复了长期失效的测试,并修正了一个潜在的功能缺失。建议在合并后监控 CI 中该测试的通过情况。
参与讨论