默认开启 JIT 自定义 AR v2
建议关注此 PR,因为它是默认行为变更,可能影响所有 CUDA 用户的推理性能。尤其是之前依赖原始 all-reduce 实现的用户应测试回归。
SGLang is a high-performance serving framework for large language models and multimodal models.
默认开启 JIT 自定义 AR v2
建议关注此 PR,因为它是默认行为变更,可能影响所有 CUDA 用户的推理性能。尤其是之前依赖原始 all-reduce 实现的用户应测试回归。
重命名 FP8 注意力环境变量为 diffusion 专属
建议精读以了解环境变量命名规范。当前 PR 未提供向后兼容,团队应尽快跟进更新相关部署配置,或在后续 PR 中添加 fallback 支持(如 new_var 未设置时读取 old_var)。
为 AMD 添加 Wan2.2 FP8 MLA 注意力测试
值得阅读此 PR 的测试模式,尤其是 `DiffusionServerBase` 的使用和 CI 注册方法。但应关注 review 中未采纳的改进点,在后续测试中进行修正,以确保参数传递正确。
AMD扩散模型FP8 MLA注意力优化,加速MI355X推理
**值得精读,尤其是** `_build_mla_prefill_metadata` 和 `_can_use_mla_prefill` 的实现,它们展示了如何将一个为DeepSeek设计的ASM内核(MLA)适配到扩散模型的DiT注意力中。关注 `@torch.compiler.disable` 的后续拆分计划。该PR为AMD平台DIffusion模型树立了FP8注意力优化的范例。
AMD Docker 镜像中 cherry-pick aiter 提交修复 mhc_pre
无需深入阅读,作为基础设施变更理解即可。
支持 Arm CPU W8A8 Int8 模型推理
建议精读。该 PR 展示了如何为 sgl-kernel 的 CPU 后端添加新架构支持,包括内核编写、构建系统集成和 Python 路由分层。值得关注的是 `i8mm_matmul` 的 tile 设计、`int8_scaled_mm_with_quant` 的量化融合以及 MoE 的完整 int8 流水线。同时 review 中对条件编译的讨论提醒了跨平台代码的兼容性处理技巧。
修复 Ascend NPU 文档目录缺少新模型页面
可以快速合入,无需深入阅读。该 PR 体现了对文档完整性的细致维护。
修复纯文本 MiMoV2 启动崩溃
值得合并,修复了一个清晰的配置-模型不一致 bug,改动小且安全。
参与讨论