Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 20:44 同步状态:空闲 下次计划:2026-08-21 21:44

PR 列表

更多筛选
2026-07-27
性能优化 重要性 6.59 洞察度 5.00

跳过无操作时的 FP32 logits 物化

值得精读:展示了通过低开销的 CPU 端批量检查来避免 GPU 端多余数据搬运的通用优化模式。PR 实现简洁,对理解 MRV2 采样器架构和后端性能优化有参考价值。

缺陷修复 重要性 6.09 洞察度 5.00

修复 Jina rerank/score 在线路径 truncate_prompt_tokens 字段丢失

该 PR 是典型的回归修复案例,值得阅读以理解代理模式下的字段透传陷阱。讨论了 `_truncate_scoring_data` 与 `truncate_prompt_tokens` 的职责分离,对理解 vLLM 的提示处理管线有参考价值。

#48774 [Perf] Tune LL BF16 Router GEMM

原始 PR · 作者 LopezCastroRoberto · 合并时间 2026-07-27 22:25

性能优化 重要性 7.85 洞察度 6.00

调优 LL BF16 Router GEMM 分发启发式用于 DeepSeek/GLM 关键模型

值得精读,尤其是对 GPU GEMM 调优感兴趣的工程师。PR 展示了如何结合端到端测量和架构感知配置来优化内核分发,以及如何用动态形状推导替代静态枚举以增强模型兼容性。未来可基于此构建自动调优器。

#49204 [Core] Fix internal LB load-balancing

原始 PR · 作者 njhill · 合并时间 2026-07-27 22:00

缺陷修复 重要性 8.27 洞察度 6.00

修复内部DP负载均衡统计发布遗漏与评分优化

值得精读,特别是 Python 与 Rust 端 LB 策略的权衡、KV 缓存压力感知评分的实现细节。对于理解 vLLM DP 架构和负载均衡设计有参考价值。

#48912 [Model] Enable EVS for Qwen3.5

原始 PR · 作者 garrygale · 合并时间 2026-07-27 21:42

功能 重要性 7.16 洞察度 5.00

为 Qwen3.5 启用 EVS 视频采样优化

值得合并,因为变更范围小,有明确的基准测试验证,且经过充分讨论。建议在未来 PR 中为 Qwen3.5 的 EVS 添加专门的集成测试,确保父类 EVS 逻辑变更时不会破坏功能。

性能优化 重要性 3.91 洞察度 7.00

减少 Triton 内核因 constexpr 导致的重复编译

值得精读,可作为消除 Triton 重编译问题的典型范例。其简洁性(仅修改一行)和清晰的性能收益展示了如何识别并修复 `tl.constexpr` 误用。推荐关注同系列 PR #48734 和 #48736,它们修复了 #48650 中的其他实例。

性能优化 重要性 5.24 洞察度 4.00

非 MoE 模型跳过 bf16 路由 GEMM 预热

值得阅读,展示了通过简单条件判断大幅优化启动性能的典型模式。MoE 相关开发人员可关注其对模型配置属性的依赖。

参与讨论