#25740 [AMD] Bump amd/Kimi-K2.5-MXFP4 revision to align with shared-experts fusion
原始 PR · 作者 yctseng0211 · 合并时间 2026-05-19 13:47
修复 Kimi-K2.5 MXFP4 测试因模型版本过旧失败
建议合并。该修复是同行 PR #25390 的配套变更,确保 AMD 路径的 Kimi-K2.5 测试不会因模型版本过旧而失败。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 yctseng0211 · 合并时间 2026-05-19 13:47
修复 Kimi-K2.5 MXFP4 测试因模型版本过旧失败
建议合并。该修复是同行 PR #25390 的配套变更,确保 AMD 路径的 Kimi-K2.5 测试不会因模型版本过旧而失败。
引入 Rust gRPC 服务器 crate,原生服务器第一阶段
值得精读,特别是对 Rust ↔ Python 桥接模式感兴趣的人员。设计决策如 `RequestAbortGuard` Drop 语义、`pyerr_to_status` 分类、`resolve_max_message_size` 环境变量覆盖,都是良好的工程实践。未解决的 meta_info 序列化和认证问题应在后续 PR 中优先修复。
原始 PR · 作者 TallMessiWu · 合并时间 2026-05-19 12:46
为 Wan2.2 Diffusion 添加 Ascend NPU MXFP4 量化支持
建议精读该 PR,它展示了如何在 diffusion 子系统中集成新的量化方法,代码模块化良好(在线 vs 离线分离),且 review 中涉及的性能优化和设计决策值得借鉴。需特别关注在线量化路径的实验性标注以及加载器逻辑对 modelslim 显式标志的改动。
原始 PR · 作者 hanming-lu · 合并时间 2026-05-19 12:13
将 Mamba 状态操作迁移到 forward stream 消除调度竞争
该 PR 值得所有关注并发调度和 Mamba 模型的开发者精读,其“捐赠模式”和“延迟操作到 forward stream”是处理调度器与前向流之间竞争的有效模式。建议合并后关注 HiCache 兼容性修复和 review 中提到的 GPU→CPU 同步优化。
MIMO-v2 EPD: GPU 图像预处理与并行视频解码
值得精读,尤其是线程数调优的 benchmark 数据和权衡过程。设计上配置灵活、默认上限保守,对类似优化有参考意义。建议补充分支测试并考虑将 import torch 移到模块顶层。
B300 默认视觉注意力回退为 triton_attn
此 PR 改动简单直接,适合快速合入以确保 B300 上的多模态功能可用。建议关注后续 FA4 在 B300 上的验证进度,验证通过后恢复 fa4 默认值。
为 Mistral Large 3 启用 FlashInfer AllReduce 融合并新增 FP8 MoE 配置
对于部署 Mistral Large 3 或类似高 MoE 模型的团队,建议合并并验证。该 PR 展示了为特定模型添加性能优化支持的典型模式:模型架构识别、自动启用特性、以及提供预调优内核配置。值得关注的是其包装器架构处理逻辑,可作为后续支持多模态模型的参考。
修复LTX2 resident默认卸载与stage profiling名称冲突
建议熟读base.py中注册名称与profile名称的设计,以及composed_pipeline_base中的去重逻辑,这是pipeline stage命名的重要设计决策。同时建议后续修复H200兼容性缺失。
参与讨论