Prhub

sgl-project/sglang · 标签视图

标签列表

聚合结果

sgl-kernel 相关 PR

2026-08-31

#36871 [AMD] support gfx1250 on ROCM 10

原始 PR · 作者 yctseng0211 · 合并时间 2026-08-31 16:19

功能 重要性 9.36 洞察度 7.00

gfx1250 接入 ROCm 10,含内核修复与 MI45x 精度测试

值得精读,尤其是 `aiter_mxfp4_w4a8_moe.py` 与 `triton_qk_rmsnorm.py`。值得关注的决策:1) 对不可用内核采取“成熟 triton 内核 + 布局转换”替代而非修内核;2) 用 IS_GFX1250 constexpr 阻止平台 workaround 泄漏到通用路径;3) 用环境变量矩阵管理多模型精度测试的可复现配置。对维护者:aiter 版本升级(aiter#2958 之后的统一 `fused_qk_rmsnorm` 入口)与 gfx1250 触发条件 `AITER_FORCE_A8W4` 耦合较紧,建议后续引入设备级开关集中管理平台特化逻辑。

2026-08-30
缺陷修复 重要性 7.37 洞察度 8.00

修复 ROCm QuickReduce BF16→FP16 溢出造成的非有限输出

值得精读。核心亮点是三层防御:FP16_OVFL 寄存器饱和兜底、per-codec 的 2 幂范围保护(分析清楚为什么量化 codec 不能用)、显式 ISA 转换阻断编译器重排。提交历史中的 S = 16 → 2 → 1 调参过程展示了如何用端到端 perplexity 和相对 L2 数据驱动数值设计决策,是内核级数值修复的可借鉴范本。建议同时阅读 #37132 的空 asm barrier 替代方案,理解 CDNA 系列 ISA 差异对可移植性的约束。

2026-08-29
缺陷修复 重要性 6.38 洞察度 5.00

修复 CPU 后端双向注意力被误加因果掩码

值得精读,尤其是内核 stage-2 循环中 `num_keys` 计算与掩码条件如何用一个 `is_causal` 布尔参数同时支持因果与双向两种模式,以及 C++ 内核与 Python 后端之间参数透传的完整链路(声明、schema 注册、backend 调用、测试接线)。该 PR 是理解 SGLang 后端抽象层如何对齐不同硬件实现(CPU AMX 与 Triton)的较好样例;如果你的团队维护 CPU 或注意力后端,建议同步关注测试覆盖缺口。

2026-08-28
性能优化 重要性 5.67 洞察度 5.00

提升 gfx950 topk_transform 内核占用率

建议精读。该 PR 虽然改动简单,但体现了通过精细控制共享内存预算来平衡性能与精度的工程实践。值得关注其决策过程:如何通过分析内核的 LDS 需求,在占用率和正确性之间找到平衡点。对于维护 AMD 内核的工程师,此调整提供了有用的参考。

2026-08-27

#34492 XPU: remove SGLANG_USE_SGL_XPU flag

原始 PR · 作者 Xia-Weiwen · 合并时间 2026-08-27 17:38

重构 重要性 7.04 洞察度 5.00

移除 XPU 开关,默认启用 sgl-kernel MoE,可参数回退

值得精读。关注三个设计决策:一是「环境变量开关 → server args 显式后端」的配置收敛模式,可复用到其他平台的类似开关清理;二是双路径并存的分支写法 `is_xpu() and not get_moe_runner_backend().is_triton()`,在保持默认高性能的同时保留逃生通道;三是参数化测试对后端优先级矩阵的覆盖方式(server 参数优先于 layer 参数),可作同类后端选择测试的参考模板。

#35222 [CPU] Enable ERNIE models on CPU

原始 PR · 作者 ZailiWang · 合并时间 2026-08-27 10:13

功能 重要性 5.90 洞察度 4.00

CPU 后端启用 ERNIE 模型推理

建议精读。这个 PR 以极小 diff 解决“内核契约与权重格式不一致”的典型问题,并通过 review 展示了原地 vs 非原地张量操作的坑;值得关注的设计点是:把设备差异尽量收敛在 Python 层、让内核契约保持简单。合并前建议补一条针对 BF16 + 2D `correction_bias` 的单元测试。

缺陷修复 重要性 3.62 洞察度 3.00

sglang-kernel 声明 PyTorch ABI 依赖,修复版本组合不兼容。

值得阅读,虽是简单元数据修改,但解决了真实的安装兼容性问题,并且为其他平台(CPU/ROCm/MUSA)提供了分平台声明依赖的参考。

#36397 [NVIDIA] Tune custom all reduce v2 for sm_107

原始 PR · 作者 trevor-m · 合并时间 2026-08-27 06:19

性能优化 重要性 7.19 洞察度 5.00

为 sm_107 调优自定义 allreduce v2 性能

建议阅读该 PR,了解如何针对新 GPU 架构调优通信内核的启发式阈值和块数。值得关注的设计决策包括:使用 CUDA 次要版本区分架构(sm_107 与 sm_100 同主版本),以及通过 `mc_blocks` 字典管理不同 world size 的 multicast 块数。对于需要支持新架构的开发者,这是一个可作为模板的范例。