Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58

PR 列表

更多筛选
2026-08-27
缺陷修复 重要性 6.16 洞察度 5.00

修复 B580 上 cross-encoder rerank 挂起,按显存跳过测试。

该 PR 值得一读,特别是对于处理跨平台 CI 中硬件差异问题的工程师。核心设计决策——按显存大小动态选择测试配置,并在不稳定配置下跳过而非降级——具有参考价值。但注意该 PR 最终采用了跳过策略,而非最初设想的 bf16 后备,因此阅读时需关注提交历史中的演进。

缺陷修复 重要性 5.07 洞察度 4.00

ROCm 回退 decode retraction 后备后端到 CPU tensor

该 PR 值得快速了解,因为它是一个重要的平台兼容性修复。应关注后续 #35233 的指针别名修复以及重新启用 host_pool 的时机。

功能 重要性 9.36 洞察度 7.00

新增 Ling-3.0-flash 混合 MoE 模型支持,含 DSPARK 投机解码

值得精读,尤其建议关注三点设计:metadata_glue_graph 以"capture 设备算子 + 快照恢复宿主对象"消除 bs=1 spec decode 的 host 开销,及其对 host-fed plan 的静默失败防线;KDA safe-gate 如何在共享接口上以"不支持则回退 Triton 内核"的方式向后兼容;routed scaling 双应用这类跨 helper 交互 bug 的排查方法。对只想使用模型的人,直接参考 PR body 的 benchmark 表与部署 recipe(#34363)。

重构 重要性 6.67 洞察度 5.00

泛化混合 SWA MTP 草稿池路由,去除架构特定判断。

该 PR 值得精读,尤其是 kv_cache_configurator.py 中的泛化条件重构,展示了如何将架构特定逻辑提炼为通用元数据驱动的模式。建议关注 `is_hybrid_swa_mtp_draft` 与 `draft_swa_full_capacity` 的判定逻辑,以及 `pool_configurator.py` 中如何从 `mtp_local_layer_ids` 推导 `_draft_swa_full_layers_num`。后续应补充针对非 Inkling 混合 SWA 模型的专用测试。

#31626 [Feature] Beam search support

原始 PR · 作者 hnyls2002 · 合并时间 2026-08-27 07:56

功能 重要性 9.36 洞察度 8.00

请求级 beam search:列式 member-row 架构支持超宽 beam

值得精读。重点看三处设计:coordinator.py 的 select/commit 双半边拆分(overlap 下如何保持 tensor 侧无 D2H)、fork.py 的 share-on-fork KV 与 group 级去重释放、batch_tail.py 的列式行布局与剥离。评审对 admission 错误处理「fail-fast 而非 skip」的结论也值得借鉴。阅读时建议搭配 test/registered/unit/beam_search 与 test/manual/beam_search 负载测试,理解资源账目与 retract 边界。

缺陷修复 重要性 5.52 洞察度 6.00

修复 _is_compiling 导致 dynamo 追踪崩溃

该 PR 值得精读,因为其根因分析展示了 import 顺序如何影响 dynamo 追踪,以及如何通过简单的 import 改写避免。对于维护涉及 torch.compile 与动态 import 的开发者有参考价值。

缺陷修复 重要性 3.62 洞察度 3.00

sglang-kernel 声明 PyTorch ABI 依赖,修复版本组合不兼容。

值得阅读,虽是简单元数据修改,但解决了真实的安装兼容性问题,并且为其他平台(CPU/ROCm/MUSA)提供了分平台声明依赖的参考。

#36397 [NVIDIA] Tune custom all reduce v2 for sm_107

原始 PR · 作者 trevor-m · 合并时间 2026-08-27 06:19

性能优化 重要性 7.19 洞察度 5.00

为 sm_107 调优自定义 allreduce v2 性能

建议阅读该 PR,了解如何针对新 GPU 架构调优通信内核的启发式阈值和块数。值得关注的设计决策包括:使用 CUDA 次要版本区分架构(sm_107 与 sm_100 同主版本),以及通过 `mc_blocks` 字典管理不同 world size 的 multicast 块数。对于需要支持新架构的开发者,这是一个可作为模板的范例。

参与讨论