#46806 Remove mantis
原始 PR · 作者 xianbaoqian · 合并时间 2026-07-01 15:13
移除低使用率的 Mantis 多模态模型
此 PR 价值在于展示了基于数据驱动的技术债务清理方法。对于大多数开发者,无需深入阅读代码细节;但若需要了解如何安全移除模型架构,可作为参考。关注点:保持版本记录(registry.py 中添加了最后支持版本),确保用户可追踪兼容性。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 xianbaoqian · 合并时间 2026-07-01 15:13
移除低使用率的 Mantis 多模态模型
此 PR 价值在于展示了基于数据驱动的技术债务清理方法。对于大多数开发者,无需深入阅读代码细节;但若需要了解如何安全移除模型架构,可作为参考。关注点:保持版本记录(registry.py 中添加了最后支持版本),确保用户可追踪兼容性。
原始 PR · 作者 chaunceyjiang · 合并时间 2026-07-01 15:07
修复 beam search 中 logprobs 数量不同时的索引越界
建议合并。该 PR 修复了真实 bug,重构后逻辑更直观易维护,且通过了已有和新增测试。
修复 Rust 前端 max_tokens: null 时生成无限制
值得立即合并,Rust 前端与 Python 前端的行为一致性修复。设计上利用已有的 `Normalizable` trait 和 `ValidatedJson` 提取器,无侵入性,值得效仿。
为 ARM CPU 添加 tanh AOR 加速 GELU 激活
本 PR 值得 ARM CPU 用户和管理者关注。设计上采用了分层架构(C++ 内核 → 向量化包装 → Python CustomOp → 平台配置),清晰隔离平台相关代码。建议后续将 `gelu_tanh` 测试从单一值扩展到随机张量,并考虑将 NEON 优化推广到更多激活函数。
修复 ROCm LoRA MoE Triton 核显存不足错误
建议合并。该 PR 修复了一个具体的运行时错误,改动简洁且经过平台隔离,逻辑正确。
修复 AMD CI LoRA TP 分布式测试环境变量和 Quark 兼容性
推荐合并。此 PR 修复了 AMD CI 测试稳定性的两个实际问题,修改范围小且经过验证(已获得批准)。团队应在 Quark 0.12 发布后及时跟进,移除跳过逻辑。
CPU 推测解码流覆盖方法移除,简化架构
该 PR 值得精读,因为它展示了如何通过全局 monkey patch 优雅地消除分支代码,是减少后端特定代码冗余的经典模式。关注 `_StreamPlaceholder` 的 `device` 属性添加,以及 monkey patch 如何使 GPU 代码路径在 CPU 上无缝工作。
引入可插拔 sleep 模式后端抽象,默认行为不变
值得精读。该 PR 的设计模式(可插拔后端 ABC + 工厂 + 能力标志)是 vLLM 中类似 attention backend 模式的延续,可以作为其他需要多后端支持的场景(如 KV 传输、调度)的参考。对于想贡献新 sleep 后端的开发者,这是必读的接口规范。
参与讨论