Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42

PR 列表

更多筛选
2026-06-16
缺陷修复 重要性 6.58 洞察度 5.00

修复 MoE 路由输出在共享专家加前未反填充的回归

该 PR 值得精读,尤其是在使用 MoE 模型和 flashinfer_trtllm 后端的场景。其设计决策体现了对张量内存布局和量化后填充的细致考虑。建议后续关注类似的条件判断谨慎避免 AND/OR 混淆。

功能 重要性 6.00 洞察度 5.00

支持 Ampere 上 modelopt_mixed 量化

值得精读。此 PR 展示了一项看似微小的变更(将 89 改为 80)如何通过深入理解内核需求而解锁 Ampere 上的重要功能。设计决策清晰,注释充分。同时注意其依赖的 KV 缓存错误处理(#43914)以确保整体体验。

缺陷修复 重要性 8.76 洞察度 5.00

适配 Transformers v5 的多模态处理和 CI 测试兼容性

本 PR 值得精读,尤其是 `_restore_fp32_rope_buffers` 的 `_apply` 覆盖模式和多模态处理器向 HF 上游对齐的设计思路。对于关注多模态模型兼容性和 ROCm CI 稳定的开发者,建议仔细 review `musicflamingo.py` 和 `audioflamingo3.py` 的变更。同时,注意测试注册表中的版本门控策略,未来维护时需保持更新。

功能 重要性 6.18 洞察度 4.00

为ZenCPU平台增加运行时日志和文档

此PR值得精读,特别是日志添加模式(debug_once统一为所有路径添加)和测试设计(硬件无关的mock测试),可作为平台可观测性增强的参考范本。

重构 重要性 7.70 洞察度 3.00

移除已废弃的 Fp8OnlineLinearMethod 类

可作为 '预定清理' 的标准范例学习,了解如何安全移除已废弃的公共类。量化模块开发者尤其应关注新类属性的完整性,后续扩展时可直接修改此文件。

增加 Mooncake PD 分离推理的 PP prefill 支持

值得精读,尤其是 `_align_transfer_regions` 的层名对齐设计和 `should_launch_bootstrap_server` 的启动条件讨论。建议在合并后尽快补充多节点端到端集成测试。

功能 重要性 9.18 洞察度 7.00

DeepSeek-OCR 视觉编码器双路径 CUDA 图形支持

该 PR 值得精读,尤其是双路径图的设计模式:如何通过独立预算和路径回退避免动态形状问题。EncoderCudaGraphManager 的泛化支持(dict[str, dict])为未来多模型多路径图提供了扩展基础。建议关注 CI 测试的重新开启和显存优化。

#45631 Add Triton recompile detection

原始 PR · 作者 gau-nernst · 合并时间 2026-06-16 18:25

功能 重要性 7.25 洞察度 5.00

新增 Triton 重新编译检测与 verbose 标志

值得精读,特别是需要排查 Triton 编译性能问题的工程师。设计上采用 CLI 参数而非环境变量,符合 vLLM 可观测性体系,值得借鉴。

参与讨论