Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-05-06
缺陷修复 重要性 4.35 洞察度 3.00

XPU 平台禁用 CUDA graph 内存估算

值得合入,修复明确,审查充分。建议精读的开发者关注 `vllm/v1/worker/gpu_worker.py` 中的内存估算逻辑,了解跨平台条件判断的设计模式。

#40759 [Examples] Resettle Disaggregated examples.

原始 PR · 作者 noooop · 合并时间 2026-05-06 16:20

重构 重要性 5.13 洞察度 2.00

将分散的 disaggregated 示例集中到 examples/disaggregated/

作为 examples 目录重构的第一步,值得关注后续其他场景(如 pooling、structured_outputs)的迁移。无需深入审查代码逻辑,但可了解新目录结构以便日后查找示例。

#40726 [Bugfix] Fix codegen for unqualified names

原始 PR · 作者 Lucaskabela · 合并时间 2026-05-06 16:11

缺陷修复 重要性 7.93 洞察度 6.00

修复 codegen 中未限定名称导致的 NameError

值得精读,尤其关注 `_node_ref` 的重构和 `consts` 传播机制。设计决策(将不可 eval 常量索引化而非修改 exec 命名空间)值得借鉴。

#41318 [Feat] dnnl build for AVX2 W8A8 Int8

原始 PR · 作者 tianmu-li · 合并时间 2026-05-06 15:28

功能 重要性 6.75 洞察度 5.50

为AVX2 CPU添加DNNL W8A8 INT8量化支持

值得精读。重点关注 CMake 中对多 ISA 库的链接策略(统一 dnnl_ext 而非分离编译)以及 C++ 向量类型中条件编译 fallback 的模式。该设计在保持代码复用性的同时提供了向前兼容。建议后续补充自动化测试,覆盖 AVX2 平台的量化算子。

#41186 [CPU] Add FP8 W8A16 linear support

原始 PR · 作者 yuwenzho · 合并时间 2026-05-06 15:05

功能 重要性 8.96 洞察度 5.00

CPU 端 FP8 W8A16 块量化线性支持

建议阅读者重点关注: - `CPUFp8BlockScaledMMKernel` 的实现模板,可参考添加其他 CPU 量化核。 - `process_weights_after_loading` 中权重打包和参数替换的模式。 - 注册位置争议,需与框架维护者确认 `_POSSIBLE_FP8_BLOCK_KERNELS` 与 `_POSSIBLE_WFP8A16_KERNELS` 的语义差异。 - 测试套件的参考实现组织方式。

功能 重要性 6.14 洞察度 4.00

允许多模态模型在并行推测解码时启动

值得合入。该 PR 解决了一个实际的使用痛点,改动小且安全。建议精读 `llm_base_proposer.py` 中的 `_warn_if_multimodal` 方法,理解 vLLM 团队如何处理暂不支持功能的降级策略。

#37243 [ROCm][CI] Refine gating tests

原始 PR · 作者 AndreasKaratzas · 合并时间 2026-05-06 13:05

基础设施 重要性 5.36 洞察度 4.00

调整ROCm CI门控测试的设备映射与镜像配置

对于关注 vLLM CI 基础设施和 ROCm 测试门控的团队成员,本 PR 值得精读。特别是 run-amd-test.sh 中条件引用的修复,体现了处理 CI 测试命令传递的细致考虑。其余配置更改较为直接,留意评论中提及的潜在不一致即可。

参与讨论