#41344 [XPU] Disable CUDA graph memory estimate on XPU platform
原始 PR · 作者 chaojun-zhang · 合并时间 2026-05-06 16:38
XPU 平台禁用 CUDA graph 内存估算
值得合入,修复明确,审查充分。建议精读的开发者关注 `vllm/v1/worker/gpu_worker.py` 中的内存估算逻辑,了解跨平台条件判断的设计模式。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 chaojun-zhang · 合并时间 2026-05-06 16:38
XPU 平台禁用 CUDA graph 内存估算
值得合入,修复明确,审查充分。建议精读的开发者关注 `vllm/v1/worker/gpu_worker.py` 中的内存估算逻辑,了解跨平台条件判断的设计模式。
将分散的 disaggregated 示例集中到 examples/disaggregated/
作为 examples 目录重构的第一步,值得关注后续其他场景(如 pooling、structured_outputs)的迁移。无需深入审查代码逻辑,但可了解新目录结构以便日后查找示例。
原始 PR · 作者 Lucaskabela · 合并时间 2026-05-06 16:11
修复 codegen 中未限定名称导致的 NameError
值得精读,尤其关注 `_node_ref` 的重构和 `consts` 传播机制。设计决策(将不可 eval 常量索引化而非修改 exec 命名空间)值得借鉴。
为AVX2 CPU添加DNNL W8A8 INT8量化支持
值得精读。重点关注 CMake 中对多 ISA 库的链接策略(统一 dnnl_ext 而非分离编译)以及 C++ 向量类型中条件编译 fallback 的模式。该设计在保持代码复用性的同时提供了向前兼容。建议后续补充自动化测试,覆盖 AVX2 平台的量化算子。
CPU 端 FP8 W8A16 块量化线性支持
建议阅读者重点关注: - `CPUFp8BlockScaledMMKernel` 的实现模板,可参考添加其他 CPU 量化核。 - `process_weights_after_loading` 中权重打包和参数替换的模式。 - 注册位置争议,需与框架维护者确认 `_POSSIBLE_FP8_BLOCK_KERNELS` 与 `_POSSIBLE_WFP8A16_KERNELS` 的语义差异。 - 测试套件的参考实现组织方式。
跳过 PP 最后一 rank 的采样 token 接收
值得精读,虽然改动很小,但体现了一个边界条件错误的发现和验证过程。新增的测试是良好的回归保障,设计数据驱动的参数化测试值得借鉴。
允许多模态模型在并行推测解码时启动
值得合入。该 PR 解决了一个实际的使用痛点,改动小且安全。建议精读 `llm_base_proposer.py` 中的 `_warn_if_multimodal` 方法,理解 vLLM 团队如何处理暂不支持功能的降级策略。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-05-06 13:05
调整ROCm CI门控测试的设备映射与镜像配置
对于关注 vLLM CI 基础设施和 ROCm 测试门控的团队成员,本 PR 值得精读。特别是 run-amd-test.sh 中条件引用的修复,体现了处理 CI 测试命令传递的细致考虑。其余配置更改较为直接,留意评论中提及的潜在不一致即可。
参与讨论