暴露 stream_interval 作为请求级采样参数
此 PR 设计简洁,clamp 模式值得在其他请求级参数中借鉴。建议阅读 `vllm/v1/engine/output_processor.py` 中的 clamp 逻辑和测试用例,以理解安全边界的设计思路。
A high-throughput and memory-efficient inference and serving engine for LLMs
暴露 stream_interval 作为请求级采样参数
此 PR 设计简洁,clamp 模式值得在其他请求级参数中借鉴。建议阅读 `vllm/v1/engine/output_processor.py` 中的 clamp 逻辑和测试用例,以理解安全边界的设计思路。
原始 PR · 作者 chaojun-zhang · 合并时间 2026-07-27 11:22
XPU 启用 QK Norm + RoPE 融合编译 pass
值得精读并合并。设计清晰且安全:将条件从 `is_cuda_alike` 扩展到 `is_cuda_alike or is_xpu`,同时将两个 pass 一起移入,保持了平台间的对称性。基准测试数据扎实,证明了性能收益和精度无损。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-07-27 11:19
AMD CI 全局 GPU 内存清理改为 opt-in
建议 AMD CI 维护人员确认相关测试是否已正确设置 `VLLM_TEST_CLEAN_GPU_MEMORY=1`。此 PR 提供了合理的设计决策,值得阅读。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-07-27 11:12
缩减 ROCm V1 attention 测试耗时
建议阅读,特别是 collection-time 参数验证的设计,可推广到其他需要根据运行时能力跳过测试的场景。
修复 MRV2 mamba_hybrid.py 中 GPU-CPU 同步错误
值得合并,改动简洁且正确。开发者可学习 `fill_` 在避免同步上的应用。
原始 PR · 作者 edwinlim0919 · 合并时间 2026-07-27 10:10
为 MoRIIO 添加异构 TP/DP 并行路由支持
值得精读。该 PR 展示了在异构并行环境下如何优雅地解决 KV 传输路由问题,特别是死锁预防和负载均衡的设计。对于了解 MoRIIO 内部机制和分布式推断性能优化的开发者而言,其中的 `_eager_handshake_all_dp_ranks` 和 `_next_flex_tp_rank` 实现具有较高学习价值。建议关注配套的 RFC #46107 和相关 PR #46115、#47495 以获取完整上下文。
限制 dummy request token 数不超过 max_model_len
值得精读:表面上是一次简单的余数分配调整,但它是理解 vLLM 中 dummy batch 与 CUDA graph 捕获机制交互的绝佳切入点。设计决策(如为何必须将多 token request 放在 batch 末尾)涉及 attention kernel 的 block-table 布局和 paged attention 的访问模式,是重要的边界条件案例。此外,该 PR 展示了如何通过集中修复一个底层 bug 来解锁上游优化 PR(#49364),体现了依赖管理的价值。
修复 xpu_mla_sparse 中全掩码块引发的 NaN 污染
该 PR 修复了一个重要的数值 Bug,改动极小(两行),新增的回归测试充分覆盖了边缘情况。虽然有轻微精度下降报告但可能是噪声,建议合并并后续监控。
参与讨论