跳过无操作时的 FP32 logits 物化
值得精读:展示了通过低开销的 CPU 端批量检查来避免 GPU 端多余数据搬运的通用优化模式。PR 实现简洁,对理解 MRV2 采样器架构和后端性能优化有参考价值。
A high-throughput and memory-efficient inference and serving engine for LLMs
跳过无操作时的 FP32 logits 物化
值得精读:展示了通过低开销的 CPU 端批量检查来避免 GPU 端多余数据搬运的通用优化模式。PR 实现简洁,对理解 MRV2 采样器架构和后端性能优化有参考价值。
原始 PR · 作者 umut-polat · 合并时间 2026-07-27 22:52
修复 Jina rerank/score 在线路径 truncate_prompt_tokens 字段丢失
该 PR 是典型的回归修复案例,值得阅读以理解代理模式下的字段透传陷阱。讨论了 `_truncate_scoring_data` 与 `truncate_prompt_tokens` 的职责分离,对理解 vLLM 的提示处理管线有参考价值。
原始 PR · 作者 guan404ming · 合并时间 2026-07-27 22:37
移除 DiffusionGemma 的 SupportsPP 接口,启动时拒绝 PP
值得参考:展示了通过移除接口声明来避免运行时错误的设计模式,比运行时检查更简洁。
原始 PR · 作者 LopezCastroRoberto · 合并时间 2026-07-27 22:25
调优 LL BF16 Router GEMM 分发启发式用于 DeepSeek/GLM 关键模型
值得精读,尤其是对 GPU GEMM 调优感兴趣的工程师。PR 展示了如何结合端到端测量和架构感知配置来优化内核分发,以及如何用动态形状推导替代静态枚举以增强模型兼容性。未来可基于此构建自动调优器。
修复内部DP负载均衡统计发布遗漏与评分优化
值得精读,特别是 Python 与 Rust 端 LB 策略的权衡、KV 缓存压力感知评分的实现细节。对于理解 vLLM DP 架构和负载均衡设计有参考价值。
为 Qwen3.5 启用 EVS 视频采样优化
值得合并,因为变更范围小,有明确的基准测试验证,且经过充分讨论。建议在未来 PR 中为 Qwen3.5 的 EVS 添加专门的集成测试,确保父类 EVS 逻辑变更时不会破坏功能。
原始 PR · 作者 liminfei-amd · 合并时间 2026-07-27 21:24
减少 Triton 内核因 constexpr 导致的重复编译
值得精读,可作为消除 Triton 重编译问题的典型范例。其简洁性(仅修改一行)和清晰的性能收益展示了如何识别并修复 `tl.constexpr` 误用。推荐关注同系列 PR #48734 和 #48736,它们修复了 #48650 中的其他实例。
非 MoE 模型跳过 bf16 路由 GEMM 预热
值得阅读,展示了通过简单条件判断大幅优化启动性能的典型模式。MoE 相关开发人员可关注其对模型配置属性的依赖。
参与讨论