Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42

PR 列表

更多筛选
2026-06-11

#39400 [Doc] Switch K8S examples to default MP mode

原始 PR · 作者 panpan0000 · 合并时间 2026-06-11 02:17

文档 重要性 4.51 洞察度 3.00

K8s 示例切换为默认 MP 分布式后端

建议阅读此 PR 以了解 vLLM 从 Ray 到 MP 的迁移决策及其文档化方式。对于 K8s 部署用户,可直接参考更新后的示例。

缺陷修复 重要性 5.15 洞察度 3.00

修复 V2 Model Runner 下 CohereASRDecoder 缺少 embed_input_ids 属性

该 PR 作为 bugfix 直接且安全,建议合并。对于架构名称的硬编码,未来可考虑更抽象的接口(如 is_encoder_decoder 或 supports_embed_input_ids 属性),但当前最小化修复策略合理。

缺陷修复 重要性 2.33 洞察度 2.00

固定 apache-tvm-ffi 版本至 0.1.10 解决 DSV4 启动崩溃

此 PR 为简单的版本锁定修复,值得合并。建议在后续 ROCm 依赖升级时注意检查 `apache-tvm-ffi` 与 `tilelang` 的版本兼容性。

#45047 [Bugfix] Fix Llama4 weight loading

原始 PR · 作者 tlrmchlsmth · 合并时间 2026-06-11 01:40

缺陷修复 重要性 6.46 洞察度 5.00

修复 Llama4 等模型权重加载 KeyError

建议精读此 PR,尤其是 `maybe_remap_moe_expert_param_name` 的泛化技巧,以及如何通过单点修改覆盖多个模型。可作为 MoE 重构后兼容性补丁的典型范例。

缺陷修复 重要性 6.21 洞察度 5.00

修复 Nemotron 模型精度下降问题

值得立即合并(已合并)。对于维护 MoE 模型的开发者,建议将 `FusedMoE` 中类似的一处缩放逻辑写成更清晰的注释或提取为辅助函数,防止未来再次引入双重缩放。

功能 重要性 6.68 洞察度 5.00

为混合缓存实现 Marconi 式共享前缀准入策略,提升 Qwen 等模型缓存命中率

值得精读。该 PR 展示了如何在不修改 kernel 的情况下利用现有缓存机制实现高级缓存准入策略,设计思路可推广到其他 hybrid attention 模型。

参与讨论