移除 MoE prefill CUDA graph 禁用保护
该 PR 是清晰的 bugfix,移除了一个意外的 guard。值得关注其背后的 IMA 问题(#27712)的后续修复。对于受影响的用户,建议在社区跟踪 IMA 问题的进展。
SGLang is a high-performance serving framework for large language models and multimodal models.
移除 MoE prefill CUDA graph 禁用保护
该 PR 是清晰的 bugfix,移除了一个意外的 guard。值得关注其背后的 IMA 问题(#27712)的后续修复。对于受影响的用户,建议在社区跟踪 IMA 问题的进展。
原始 PR · 作者 luoroger37 · 合并时间 2026-06-11 18:25
修复 SWA 分配器分页释放时映射残留导致 double-free
建议精读 `_expand_to_full_pages` 的实现和 `free_swa` 的变更逻辑,这是一个典型的分配器 bug 修复,体现了分页分配语义与逐 token 映射之间的不匹配问题,设计值得学习。
融合 sigmoid 和乘法为一个 Triton kernel,降低 AMD GPU 延迟
本 PR 是一个针对 AMD GPU 的精准性能优化,内核实现简洁清晰,测试配套完整。值得关注的设计要点是:使用 `_is_hip` 条件编译避免影响 CUDA 路径;Triton kernel 内部提升精度至 float32 的做法。适合作为 Triton kernel 融合模式的入门参考。
AMD HIP 启用 GDN QKV 融合拆分核
建议合入。改动简洁、风险低、收益明确。可作为 AMD GPU 上 Triton kernel 启用策略的参考案例。
修复 spec CI fp16 NaN 问题:测试改用 bf16 并清理 NaN logits
值得精读。特别是 `_AsyncNanWarner` 的设计(利用 pin_memory 避免同步)和 `sanitize_nan_logits` 的数值选择(+-1e30 而非 dtype min/max 以避免温度缩放后溢出)。
原始 PR · 作者 kkHuang-amd · 合并时间 2026-06-11 16:06
修复 AMD DSV4 MoE 性能:传递 intermediate_pad 参数
该 PR 值得精读,特别是性能调优方法:通过微观基准定位到内核参数缺失,再用端到端测试验证。设计上记录了填充量并在内核调用处传递,是一种清晰的解耦方式。Shuffle 函数的清理也提高了代码可维护性。
原始 PR · 作者 arathi-hlab · 合并时间 2026-06-11 13:14
重构 XPU CI 容器镜像拉取策略并修复权限问题
建议合并此 PR。虽然没有功能性的修改,但显著提升了 XPU CI 的健壮性和可维护性。值得关注的设计决策是:直接依赖 `:latest` 标签权衡了便利性与一致性,团队应确保发布工作流打 `:latest` 标签的时机合适且明确。
支持 Xeon CPU 容器以非 root 用户运行
值得关注的设计决策:将 uv 可执行文件移至 /usr/local/bin 并设置共享的 python 解释器路径,实现容器化部署的权限分离。建议在文档中补充非 root 运行说明,并考虑增加镜像层缓存以优化构建速度。
参与讨论