Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42

PR 列表

更多筛选
2026-05-02

#40830 [MM][CG] Support ViT CG for Qwen2.5-VL

原始 PR · 作者 johncalesp · 合并时间 2026-05-02 11:10

功能 重要性 8.79 洞察度 6.00

为 Qwen2.5-VL 启用 ViT CUDA 图支持

该 PR 设计清晰,遵循了已批准的 Qwen3-VL 实现模式。核心决策是将元数据计算与模型前向分离,实现了跳帧和图模式的代码复用。值得关注的是文中对视频修剪与 CUDA 图交互的处理策略(直接禁用),以及通过参数覆盖保证图形状安全的方法。建议阅读 `prepare_encoder_metadata` 和 `get_encoder_cudagraph_config` 的实现。

缺陷修复 重要性 5.29 洞察度 5.00

同步 Gemma4 聊天模板至 HF 最新版,修复格式与工具调用问题

建议合并此 PR,它使 vLLM 的 Gemma4 模板与官方保持同步,并修复了多个已知格式问题。对于大多数人无害,但应关注 turn 标签相关的讨论以防意外。

#41458 Re-enable allreduce rms fusion for DP / PP

原始 PR · 作者 andylolu2 · 合并时间 2026-05-02 07:01

性能优化 重要性 5.02 洞察度 3.00

重新启用 DP/PP 下 allreduce RMS 融合

建议使用 DP 或 PP 的用户仔细阅读本 PR 以了解融合启用条件。对于维护者,这是一个很好的参考案例,展示了如何追踪上游依赖修复并移除临时限制。设计决策上值得学习的是对风险-收益的权衡,未添加版本检查而是信任依赖版本管理。

#41443 [DSV4] Add knob to enable pre-attn gemm

原始 PR · 作者 zyongye · 合并时间 2026-05-02 03:23

性能优化 重要性 6.38 洞察度 5.00

基于 token 数量动态决定 GEMM 多流并行

值得精读,尤其是对 CUDA 多流并行的性能陷阱感兴趣的工程师。核心设计模式——用 token 阈值动态关闭并行叠加——与已有的 `VLLM_SHARED_EXPERTS_STREAM_TOKEN_THRESHOLD`(PR#41443 附近)一致,体现了 vLLM 团队对 GPU 饱和度的工程洞察。建议关注 reviewer 关于一致性覆盖和 `enable` 默认值的讨论。

性能优化 重要性 7.91 洞察度 6.00

集成 TileLang 融合核优化 DeepSeek-V4 的 hc_head 计算,减少内存开销,提升吞吐。

值得精读,尤其适合希望了解 TileLang 内核集成流程和写融合核替换 PyTorch 多步操作的工程师。该 PR 展示了设计权衡(参数调优、与现有代码对齐)和性能验证方法。

参与讨论