新增 VidCom2 视频 token 剪枝方法
推荐关注该 PR 的设计模式,特别是统一参数接口 `get_video_pruning_spec()`、协议方法声明 `supported_video_pruning_methods`、配置 fail-fast 校验等,可作为后续功能扩展的模板。
A high-throughput and memory-efficient inference and serving engine for LLMs
新增 VidCom2 视频 token 剪枝方法
推荐关注该 PR 的设计模式,特别是统一参数接口 `get_video_pruning_spec()`、协议方法声明 `supported_video_pruning_methods`、配置 fail-fast 校验等,可作为后续功能扩展的模板。
原始 PR · 作者 fxmarty-amd · 合并时间 2026-07-28 10:35
将 Quark OCP MX AITER 内核迁移至线性抽象层
值得精读。该 PR 展示了在 vLLM 中注册一个新量化内核的完整流程:定义子类、实现抽象方法、注册到 `_POSSIBLE_*_KERNELS` 和 `_registered_linear_kernels`,并在使用方通过 `init_*_linear_kernel` 获取实例。关注 `__init__.py` 中的注册模式和 `test_mxfp4_kernel_selection.py` 中 mock 平台枚举的测试技巧。
XPU 启用在线 FP8 量化测试
本 PR 作为 XPU 平台启用测试覆盖的参考样例,值得其他平台(如 CPU)借鉴其 `is_quant_method_supported` 的扩展模式。审查时重点关注 `supported_quantization` 列表的维护成本和测试跳过的条件是否清晰。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-07-28 10:22
Python-only 安装镜像软失败
变更简单,无需精读,可合并。
原始 PR · 作者 frida-andersson · 合并时间 2026-07-28 10:12
消除 DSv3.2 稀疏 MLA 解码热循环中的冗余 FillFunctor 启动
值得精读。本 PR 展示了一个典型的性能优化模式:消除冗余 GPU 内核启动。对于运行 DeepSeek 模型且使用 ROCm 的团队,此变更可直接带来吞吐提升。同时,review 中关于工作区管理的讨论(使用 `current_workspace_manager` 替代全局变量)是值得学习的架构实践。
原始 PR · 作者 avininjamay8 · 合并时间 2026-07-28 09:26
修复 WRITE 模式远程 TP 秩折叠问题
建议精读 `moriio_common.py` 中 `add_new_req` 方法对 `remote_tp_size` 的降级处理模式,该模式在处理分布式配置键的多版本兼容性方面具有参考价值。
原始 PR · 作者 WoosukKwon · 合并时间 2026-07-28 08:06
删除 EP 实验性警告
该 PR 易于审核,可直接合并。
原始 PR · 作者 LucasWilkinson · 合并时间 2026-07-28 08:03
PCP 强制启用 V2 Model Runner
此 PR 变更简洁且必要,建议合并。可精读 `vllm/config/vllm.py` 中的 `use_v2_model_runner` 属性和 `_validate_config` 方法,理解 PCP 与 V2 的绑定模式。后续可考虑为 PCP 相关配置添加更多测试覆盖。
参与讨论