Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-06-11

#27841 Remove MoE prefill CUDA graph disable guard

原始 PR · 作者 mmangkad · 合并时间 2026-06-11 18:30

缺陷修复 重要性 5.71 洞察度 5.00

移除 MoE prefill CUDA graph 禁用保护

该 PR 是清晰的 bugfix,移除了一个意外的 guard。值得关注其背后的 IMA 问题(#27712)的后续修复。对于受影响的用户,建议在社区跟踪 IMA 问题的进展。

#27779 Fix paged SWA free mapping cleanup

原始 PR · 作者 luoroger37 · 合并时间 2026-06-11 18:25

缺陷修复 重要性 6.44 洞察度 5.00

修复 SWA 分配器分页释放时映射残留导致 double-free

建议精读 `_expand_to_full_pages` 的实现和 `free_swa` 的变更逻辑,这是一个典型的分配器 bug 修复,体现了分页分配语义与逐 token 映射之间的不匹配问题,设计值得学习。

性能优化 重要性 7.73 洞察度 5.00

融合 sigmoid 和乘法为一个 Triton kernel,降低 AMD GPU 延迟

本 PR 是一个针对 AMD GPU 的精准性能优化,内核实现简洁清晰,测试配套完整。值得关注的设计要点是:使用 `_is_hip` 条件编译避免影响 CUDA 路径;Triton kernel 内部提升精度至 float32 的做法。适合作为 Triton kernel 融合模式的入门参考。

缺陷修复 重要性 7.26 洞察度 6.00

修复 spec CI fp16 NaN 问题:测试改用 bf16 并清理 NaN logits

值得精读。特别是 `_AsyncNanWarner` 的设计(利用 pin_memory 避免同步)和 `sanitize_nan_logits` 的数值选择(+-1e30 而非 dtype min/max 以避免温度缩放后溢出)。

性能优化 重要性 6.11 洞察度 6.00

修复 AMD DSV4 MoE 性能:传递 intermediate_pad 参数

该 PR 值得精读,特别是性能调优方法:通过微观基准定位到内核参数缺失,再用端到端测试验证。设计上记录了填充量并在内核调用处传递,是一种清晰的解耦方式。Shuffle 函数的清理也提高了代码可维护性。

基础设施 重要性 4.52 洞察度 2.00

重构 XPU CI 容器镜像拉取策略并修复权限问题

建议合并此 PR。虽然没有功能性的修改,但显著提升了 XPU CI 的健壮性和可维护性。值得关注的设计决策是:直接依赖 `:latest` 标签权衡了便利性与一致性,团队应确保发布工作流打 `:latest` 标签的时机合适且明确。

基础设施 重要性 3.43 洞察度 4.00

支持 Xeon CPU 容器以非 root 用户运行

值得关注的设计决策:将 uv 可执行文件移至 /usr/local/bin 并设置共享的 python 解释器路径,实现容器化部署的权限分离。建议在文档中补充非 root 运行说明,并考虑增加镜像层缓存以优化构建速度。

参与讨论