Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-05-19

#42819 [BugFix] support PP for Cohere vision model

原始 PR · 作者 czhu-cohere · 合并时间 2026-05-19 02:12

缺陷修复 重要性 5.78 洞察度 4.00

支持 Cohere 视觉模型 PP

**建议合并**,但需尽快跟进修复 `forward` 方法的参数透传问题,否则此 PR 仅解决启动阶段,推理阶段仍可能崩溃。建议参考 reviewer 建议添加 `**kwargs` 传播。

重构 重要性 8.63 洞察度 6.00

重构 quark_moe W4A4 使用 oracle 后端选择机制

建议所有关注 ROCm 后端的工程师和量化框架开发者精读。该 PR 展示了如何通过 oracle 模式统一多 backend 选择,并清晰展示了重构渐变过程(3/N)。值得注意的设计决策包括:emulation 的 opt-in 策略;简化初始化流程以消除冗余条件;错误消息的可操作性改进。对于需要支持新硬件后端的工程师,此模式是很好的参考。

缺陷修复 重要性 6.98 洞察度 5.00

修复 Humming MoE 的 SiLU 激活值 clamp 缺失

值得精读。这是一个典型的“配置丢失”导致的精度 bug 修复,展示了量化配置如何影响模型输出质量。`swiglu_limit_func` 的调用位置、`FusedMoEQuantConfig` 中 clamp 参数的传播路径都很清晰,可作为类似 bug 的修复模板。

缺陷修复 重要性 6.46 洞察度 5.00

修复 DSV4 MTP HC 状态默认值及 ROCm 兼容性

此 PR 属于典型的多平台适配回归修复,体量小但关键。建议阅读以了解:1) `torch.compile` 对方法签名的严格性;2) 跨平台抽象后如何确保所有子路径参数默认值一致。值得精读并作为后续类似问题的检查清单。

性能优化 重要性 7.63 洞察度 5.00

重新启用 FlashInfer 自动调优并广播策略至所有 rank

若关注 FlashInfer kernel 性能优化或 vLLM 配置系统,建议仔细阅读该 PR。其广播策略设计值得参考,临时文件处理方面也有改进空间。

2026-05-18
缺陷修复 重要性 5.91 洞察度 3.00

修复因果模型 `--convert` 未与 `--runner` 同时传递时的崩溃

值得合并,修复了显式的用户错误(缺少 `--runner`)导致的崩溃,且与文档行为一致。变更极小,逻辑清晰,应无回归风险。

缺陷修复 重要性 6.70 洞察度 7.00

Mamba单token extends重新分类为decode

对于关注disaggregated serving和Mamba模型的开发者,建议精读此PR,特别是`_compute_common_metadata`中的分类逻辑,以及如何通过修改`is_prefilling`来匹配CUDA graph调度。设计权衡(可读性 vs 简洁性、CPU同步警告)值得关注。此外,`MockMambaBuilder`工具类可推广用于其他测试。

参与讨论