#39400 [Doc] Switch K8S examples to default MP mode
原始 PR · 作者 panpan0000 · 合并时间 2026-06-11 02:17
K8s 示例切换为默认 MP 分布式后端
建议阅读此 PR 以了解 vLLM 从 Ray 到 MP 的迁移决策及其文档化方式。对于 K8s 部署用户,可直接参考更新后的示例。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 panpan0000 · 合并时间 2026-06-11 02:17
K8s 示例切换为默认 MP 分布式后端
建议阅读此 PR 以了解 vLLM 从 Ray 到 MP 的迁移决策及其文档化方式。对于 K8s 部署用户,可直接参考更新后的示例。
原始 PR · 作者 yewentao256 · 合并时间 2026-06-11 02:06
修复 V2 Model Runner 下 CohereASRDecoder 缺少 embed_input_ids 属性
该 PR 作为 bugfix 直接且安全,建议合并。对于架构名称的硬编码,未来可考虑更抽象的接口(如 is_encoder_decoder 或 supports_embed_input_ids 属性),但当前最小化修复策略合理。
固定 apache-tvm-ffi 版本至 0.1.10 解决 DSV4 启动崩溃
此 PR 为简单的版本锁定修复,值得合并。建议在后续 ROCm 依赖升级时注意检查 `apache-tvm-ffi` 与 `tilelang` 的版本兼容性。
原始 PR · 作者 tlrmchlsmth · 合并时间 2026-06-11 01:40
修复 Llama4 等模型权重加载 KeyError
建议精读此 PR,尤其是 `maybe_remap_moe_expert_param_name` 的泛化技巧,以及如何通过单点修改覆盖多个模型。可作为 MoE 重构后兼容性补丁的典型范例。
修复非函数工具导致解析崩溃
值得快速合入,修复了明确的崩溃 bug,测试覆盖充分。
修复 Nemotron 模型精度下降问题
值得立即合并(已合并)。对于维护 MoE 模型的开发者,建议将 `FusedMoE` 中类似的一处缩放逻辑写成更清晰的注释或提取为辅助函数,防止未来再次引入双重缩放。
为混合缓存实现 Marconi 式共享前缀准入策略,提升 Qwen 等模型缓存命中率
值得精读。该 PR 展示了如何在不修改 kernel 的情况下利用现有缓存机制实现高级缓存准入策略,设计思路可推广到其他 hybrid attention 模型。
修复 MNNVL one-sided 测试 workspace 不足
此 PR 为一个测试 bugfix,代码简单,对理解 FlashInfer one-sided 机制有一定参考价值,但无需深度精读。
参与讨论