修复Qwen3.5模型的LoRA适配器支持,解决IndexError问题。
该PR值得精读,特别是模型层LoRA兼容性设计决策,如分离in_proj_qkvz层以处理GDN结构,这为其他支持LoRA的模型提供参考。同时关注gemini-code-assist[bot]提出的packed_modules_mapping修复是否已正确实施。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复Qwen3.5模型的LoRA适配器支持,解决IndexError问题。
该PR值得精读,特别是模型层LoRA兼容性设计决策,如分离in_proj_qkvz层以处理GDN结构,这为其他支持LoRA的模型提供参考。同时关注gemini-code-assist[bot]提出的packed_modules_mapping修复是否已正确实施。
原始 PR · 作者 jhsmith409 · 合并时间 2026-03-20 07:21
修复 Qwen3.5 GDN 层在量化模型下因 MergedColumnParallelLinear 无 weight 属性而抛出的 AttributeError。
建议关注 Qwen 模型维护和量化支持的开发者精读此 PR,以了解 MergedColumnParallelLinear 在量化时的属性访问差异和形状计算调整。变更虽小,但揭示了量化层与标准线性层之间的重要设计权衡。
移除MoE层的'naive' all2all后端选项,并重命名相关属性。
建议精读此PR以了解MoE后端配置的演进,特别是属性重命名的设计决策,这有助于未来类似重构。关注`vllm/model_executor/layers/fused_moe/config.py`中的属性变更,以及配置验证中的fallback机制,可作为清理已弃用选项的参考范例。
重构DefaultMoERunner的forward方法,简化MoE模块代码结构。
推荐精读此PR,关注设计决策如模块化拆分、流同步处理和分派策略,这些为后续MoE优化奠定基础。
修复ROCm平台MoRI与AITER后端FP8量化分发不兼容的bug。
建议精读此PR,了解MoE架构中FP8量化处理的设计权衡,特别是如何通过条件化属性和异常移除实现后端兼容。关注AiterExperts.expects_unquantized_inputs的条件逻辑和MoriPrepareAndFinalize.prepare中的量化跳过机制。
扩展性能指标模块对 22 种量化方法的支持,修复量化模型 MFU 报告失败问题。
建议技术管理者和工程师精读此 PR,以了解如何处理量化配置解析的扩展性问题。重点关注 `_QUANT_WEIGHT_BYTE_SIZE` 字典的设计决策,它提供了一种集中管理量化方法属性的方式。此外,review 中的测试优化建议值得关注,可作为代码重构的参考。
原始 PR · 作者 TheEpicDolphin · 合并时间 2026-03-19 06:59
为推测解码拒绝采样器添加贪婪采样支持,优化温度为零时的性能。
建议工程团队精读此PR,特别关注`_gather_draft_logits_and_target_argmax_kernel`和`_probabilistic_rejection_kernel`的设计,以及review中讨论的正确性问题。设计决策如本地argmax计算和贪婪路径隔离值得学习。
添加gpt-oss优化的Router GEMM kernel,提升低批次大小下的输出token吞吐量。
建议技术管理者和工程师精读此PR,重点关注以下设计决策: - GateLinear中多层GEMM调度的实现,如何平衡性能和通用性。 - 新kernel的错误处理和硬件兼容性检查,使用TORCH_CHECK替代assert。 - 与LoRA集成的扩展,通过GateLinearWithLoRA支持自定义路由。 这些决策展示了在优化性能时的权衡和最佳实践。
参与讨论