#42819 [BugFix] support PP for Cohere vision model
原始 PR · 作者 czhu-cohere · 合并时间 2026-05-19 02:12
支持 Cohere 视觉模型 PP
**建议合并**,但需尽快跟进修复 `forward` 方法的参数透传问题,否则此 PR 仅解决启动阶段,推理阶段仍可能崩溃。建议参考 reviewer 建议添加 `**kwargs` 传播。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 czhu-cohere · 合并时间 2026-05-19 02:12
支持 Cohere 视觉模型 PP
**建议合并**,但需尽快跟进修复 `forward` 方法的参数透传问题,否则此 PR 仅解决启动阶段,推理阶段仍可能崩溃。建议参考 reviewer 建议添加 `**kwargs` 传播。
重构 quark_moe W4A4 使用 oracle 后端选择机制
建议所有关注 ROCm 后端的工程师和量化框架开发者精读。该 PR 展示了如何通过 oracle 模式统一多 backend 选择,并清晰展示了重构渐变过程(3/N)。值得注意的设计决策包括:emulation 的 opt-in 策略;简化初始化流程以消除冗余条件;错误消息的可操作性改进。对于需要支持新硬件后端的工程师,此模式是很好的参考。
原始 PR · 作者 jinzhen-lin · 合并时间 2026-05-19 01:32
修复 Humming MoE 的 SiLU 激活值 clamp 缺失
值得精读。这是一个典型的“配置丢失”导致的精度 bug 修复,展示了量化配置如何影响模型输出质量。`swiglu_limit_func` 的调用位置、`FusedMoEQuantConfig` 中 clamp 参数的传播路径都很清晰,可作为类似 bug 的修复模板。
修复 DSV4 MTP HC 状态默认值及 ROCm 兼容性
此 PR 属于典型的多平台适配回归修复,体量小但关键。建议阅读以了解:1) `torch.compile` 对方法签名的严格性;2) 跨平台抽象后如何确保所有子路径参数默认值一致。值得精读并作为后续类似问题的检查清单。
重新启用 FlashInfer 自动调优并广播策略至所有 rank
若关注 FlashInfer kernel 性能优化或 vLLM 配置系统,建议仔细阅读该 PR。其广播策略设计值得参考,临时文件处理方面也有改进空间。
修复因果模型 `--convert` 未与 `--runner` 同时传递时的崩溃
值得合并,修复了显式的用户错误(缺少 `--runner`)导致的崩溃,且与文档行为一致。变更极小,逻辑清晰,应无回归风险。
原始 PR · 作者 yewentao256 · 合并时间 2026-05-18 23:27
修复 V2 模型运行器中 prompt logprobs 张量形状不匹配错误
值得精读用于理解 Model Runner V2 中 prompt logprobs 的处理流程,特别是跨请求变长张量切片的处理模式。该 PR 本身逻辑清晰简单,可作为参考学习。
原始 PR · 作者 netanel-haber · 合并时间 2026-05-18 23:26
Mamba单token extends重新分类为decode
对于关注disaggregated serving和Mamba模型的开发者,建议精读此PR,特别是`_compute_common_metadata`中的分类逻辑,以及如何通过修改`is_prefilling`来匹配CUDA graph调度。设计权衡(可读性 vs 简洁性、CPU同步警告)值得关注。此外,`MockMambaBuilder`工具类可推广用于其他测试。
参与讨论