Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 19:08 同步状态:空闲 下次计划:2026-09-01 20:08

PR 列表

更多筛选
2026-07-09
基础设施 重要性 3.71 洞察度 2.00

为 AMD CI 注册两个 1-GPU 测试

该 PR 属于基础设施层面的常规维护,不涉及复杂逻辑,可直接合并。值得关注的是其筛选测试的原则:优先选取不依赖 CUDA 独占特性的测试,并验证了实际运行结果,为后续 AMD CI 扩展提供了参考模式。

缺陷修复 重要性 5.75 洞察度 7.00

修复 publish event 链式记录,消除预填充撕裂窗口

值得精读,尤其关注 CUDA event 的链式记录设计模式。该模式可用于其他需要累积语义的事件同步场景。改动简洁、注释清晰,是典型的细粒度正确性修复。

缺陷修复 重要性 7.16 洞察度 5.00

映射 Nemotron-3 Super low_effort 并警告不支持级别

建议阅读本 PR,特别是 `protocol.py` 中 `normalize_reasoning_inputs` 的重构,以及 `template_detection.py` 中如何通过配置字段实现模型特定的 effort 映射。这些设计模式值得应用到其他需要差异化的模板参数中。

#29275 Fix gfx95 bpreshuffle FP8 activation scale layout

原始 PR · 作者 hdt98 · 合并时间 2026-07-09 01:55

缺陷修复 重要性 7.83 洞察度 5.00

修复 gfx950 上 FP8 bpreshuffle GEMM 的 activation scale 布局不匹配

该 PR 是 AMD gfx950 平台 block-FP8 推理的关键正确性修复,建议技术管理者优先审阅和合并。对于开发者,值得关注以下设计决策: - 如何通过 `scale.t().contiguous().t()` 在保持逻辑值不变的前提下改变物理布局,这是一种常见的 layout materialization 模式。 - 幂等性设计(`materialization_is_idempotent_for_bpreshuffle_layout` 测试)确保了即使在不同边界多次调用也不出错。 - 与上游 CK 内核的协同事宜(ROCm/rocm-libraries#8639)展示了跨仓库契约的最佳实践。

2026-07-08

#30323 Use FP32 logits in MoEGate fallbacks

原始 PR · 作者 mmangkad · 合并时间 2026-07-08 23:43

缺陷修复 重要性 6.27 洞察度 4.00

确保 MoE 门控回退路径使用 FP32 logits

值得精读以理解 SGLang 中 MoE 路由器各个精度路径的设计考量。展示了如何在尽量不引入额外性能开销的前提下修复数值精度漏洞。

#30387 Fix zero expert routed ids for MoE backends

原始 PR · 作者 BBuf · 合并时间 2026-07-08 21:23

缺陷修复 重要性 6.32 洞察度 5.00

修复零专家路由传入非法负数 id 导致 CUDA 崩溃

建议合入,但后续需跟进 review 中提出的命名问题和非 identity 路径保护。

参与讨论