#29131 [NPU] Adapt MiMo-V2.5-W8A8
原始 PR · 作者 iridiumine · 合并时间 2026-07-21 09:16
为 NPU 适配 MiMo-V2.5-W8A8,添加量化配置回退和测试覆盖
该 PR 变更虽小,但展示了在量化配置兼容性处理上一种简洁的 fallback 模式,值得类似场景参考。新增的集成测试配置完整,可作为 NPU 模型新适配的模板。建议在类似量化路径重构时考虑更统一的错误处理。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 iridiumine · 合并时间 2026-07-21 09:16
为 NPU 适配 MiMo-V2.5-W8A8,添加量化配置回退和测试覆盖
该 PR 变更虽小,但展示了在量化配置兼容性处理上一种简洁的 fallback 模式,值得类似场景参考。新增的集成测试配置完整,可作为 NPU 模型新适配的模板。建议在类似量化路径重构时考虑更统一的错误处理。
原始 PR · 作者 rahulvijayaraghavan · 合并时间 2026-07-21 09:09
XPU 启用可分段 prefill CUDA 图
值得精读。该 PR 展示了如何通过 `get_device_module()` 实现设备无关的图形捕获原语,设计模式清晰。对于关注多硬件适配或 Intel XPU 推理的开发者有直接参考价值。
修复 CPU 上 MXFP4 权重的 padding 尺寸
值得合并,修复明确且简洁。建议后续增加针对 MXFP4 + CPU AMX 的回归测试。
原始 PR · 作者 paulzhang-tm · 合并时间 2026-07-21 09:01
保留自定义op边界的注意力 LSE 以支持分段前缀 MHA
此 PR 实现了 FullCG 中 LSE 传递的关键机制,是 Chunked-prefix MHA 功能的基础。建议相关开发者精读 `radix_attention.py` 中的操作注册和 forward 逻辑。值得关注的设计决策是将 LSE 操作作为独立注册操作,避免破坏现有接口。
修复 grammar 约束推测解码时停止边界错误
建议精读。本 PR 虽小,但揭示了在多重停止条件下正确确定完成边界的通用设计问题,且 review 中关于 Future 守卫的讨论体现了对生命周期不变量的深刻理解,值得参考。
并行化 VLM 多模态预处理并支持自定义工作线程数
## 推荐意见 - 该 PR 设计稳健,性能收益显著,建议合并。 - 值得深入阅读 `executor.py` 中线程本地克隆的实现,以及 review 中安全性改进的流程。 - 对于部署了多模态模型的团队,推荐启用此功能(默认即开启),并根据实际负载微调 `--mm-processor-worker-num`。 - 建议后续增加监控指标,便于调优。
原始 PR · 作者 merrymercy · 合并时间 2026-07-21 08:36
Grammar 约束解码与推测解码 verify 阶段重叠,消除 GPU 空闲气泡
值得精读。设计思路(将 CPU 工作移到 GPU forward 窗口内)和实现细节(异步 D2H + CUDA event + pin-memory barrier)是高性能推理系统的典型技巧。代码改动清晰,注释详尽,适合作为性能优化的参考案例。
修复 MiniMax-M3 在 ROCm 上因字段不可解析导致的启动崩溃
推荐快速合并。这是一个针对特定硬件(ROCm)和模型(MiniMax-M3)的启动崩溃修复,变更量小、风险低、已验证。开发者在为模型添加覆盖声明时,应注意检查所声明的字段是否已标记 resolvable=True。
参与讨论