Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 21:57 同步状态:空闲 下次计划:2026-09-02 22:57
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-05-08

#24363 Turn on JIT custom AR implementation by default

原始 PR · 作者 b8zhong · 合并时间 2026-05-08 17:05

基础设施 重要性 5.02 洞察度 3.00

默认开启 JIT 自定义 AR v2

建议关注此 PR,因为它是默认行为变更,可能影响所有 CUDA 用户的推理性能。尤其是之前依赖原始 all-reduce 实现的用户应测试回归。

#24677 [AMD] Intro SGLANG_DIFFUSION_AITER_FP8_ATTN

原始 PR · 作者 HaiShaw · 合并时间 2026-05-08 16:31

重构 重要性 4.66 洞察度 2.00

重命名 FP8 注意力环境变量为 diffusion 专属

建议精读以了解环境变量命名规范。当前 PR 未提供向后兼容,团队应尽快跟进更新相关部署配置,或在后续 PR 中添加 fallback 支持(如 new_var 未设置时读取 old_var)。

测试 重要性 7.33 洞察度 3.00

为 AMD 添加 Wan2.2 FP8 MLA 注意力测试

值得阅读此 PR 的测试模式,尤其是 `DiffusionServerBase` 的使用和 CI 注册方法。但应关注 review 中未采纳的改进点,在后续测试中进行修正,以确保参数传递正确。

#20319 [AMD] Support fp8 MLA for diffusion model

原始 PR · 作者 yichiche · 合并时间 2026-05-08 15:56

功能 重要性 8.31 洞察度 7.00

AMD扩散模型FP8 MLA注意力优化,加速MI355X推理

**值得精读,尤其是** `_build_mla_prefill_metadata` 和 `_can_use_mla_prefill` 的实现,它们展示了如何将一个为DeepSeek设计的ASM内核(MLA)适配到扩散模型的DiT注意力中。关注 `@torch.compiler.disable` 的后续拆分计划。该PR为AMD平台DIffusion模型树立了FP8注意力优化的范例。

功能 重要性 8.29 洞察度 6.00

支持 Arm CPU W8A8 Int8 模型推理

建议精读。该 PR 展示了如何为 sgl-kernel 的 CPU 后端添加新架构支持,包括内核编写、构建系统集成和 Python 路由分层。值得关注的是 `i8mm_matmul` 的 tile 设计、`int8_scaled_mm_with_quant` 的量化融合以及 MoE 的完整 int8 流水线。同时 review 中对条件编译的讨论提醒了跨平台代码的兼容性处理技巧。

参与讨论