Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-08-17
性能优化 重要性 5.68 洞察度 4.00

新增 H20 Qwen3.8 MoE 调优配置与工具修复

值得快速阅读:若团队在 H20 或同类 GPU 上做 MoE 推理调优,这份 PR 演示了 tuned config 从生成(tuning_fused_moe_triton.py)、加载匹配到验证(micro benchmark + e2e + 数值一致性)的完整闭环。重点看配置文件的 M 分桶规律及其与默认启发式的差异、common_utils.py 架构分支组织方式,以及作者对精度噪声的论证。若没有 Qwen3.8/H20 场景,可只关注调优工具的架构识别修复一处。

文档 重要性 5.84 洞察度 2.00

首页轮播新增 MiniMax-H3 并移除 GLM-5.2

纯文档内容变更,不涉及运行时逻辑,无需精读实现。可作为“单一数据源驱动多页面展示”的配置类 PR 样例,重点关注其文案事实来源规则(从模型配置与页面提取可验证信息)以及对轮播规模的控制策略。

测试 重要性 3.96 洞察度 2.00

调整 NPU 性能用例 prefill delayer 窗口参数修复 TPOT

不建议精读,属于纯测试参数调优。值得留意的只有一点:prefill delayer 的滑动窗口大小会显著影响 NPU 上长序列场景的 decode pass 稳定性,后续若有平台调度调整,可参考本 PR 的窗口与 max-delay-passes 配套组合。

性能优化 重要性 7.83 洞察度 6.00

GLM5 共享专家 append 融合进 aiter topk,消除每层内核

值得精读,重点看三点设计:① 用持久预填充 buffer + row stride 部分列写入消除每层 kernel 启动,并与 CUDA graph 地址稳定性耦合;② 容量超限降级回 fallback 的“只影响覆盖、不影响正确性”设计哲学;③ review 中“条件镜像易碎、改用 shape 检测”的健壮性权衡,以及“server args 未初始化时优雅降级”的工程细节。同时应把“最终被 PR#35105 回滚”作为教训:特殊硬件路径优化应配套直接针对该分支的单元测试与更小粒度的 CI 验证,避免只依赖 nightly 精度套件。

#34988 [Diffusion] Reuse SRT SigLIP vision model

原始 PR · 作者 mickqian · 合并时间 2026-08-17 09:16

重构 重要性 9.18 洞察度 6.00

diffusion 复用 SRT SigLIP 视觉模型,删约 240 行重复代码

值得精读。这个 PR 展示了如何在不破坏 bit-exact 数值的前提下,跨运行时复用模型实现并同步并行组状态,尤其适合关注 diffusion/SRT 架构演进、视觉模型统一维护的工程师。建议重点阅读 `gemma_3.py` 的权重映射与 `_vision_parallel_context`,以及 `parallel_state.py` 的 patch/恢复对称逻辑——这是本 PR 最容易出问题的两个设计点。

性能优化 重要性 5.89 洞察度 6.00

LTX-2.3 lossless 路径复用 bit-exact 调制快速路径

值得精读,尤其关注两个设计决策:其一是同一算术在 eager 与 compile 两种执行模式下选择不同实现(复用 kernel vs 保持表达式可见),这是多后端/多执行模式下 kernel 复用的典型案例;其二是用 monkeypatch 将 `_ltx2_modulate` 替换为 `pytest.fail` 来反向验证编译路径隔离,测试手法低成本高信号。建议阅读时结合 `_ltx2_modulate` 与 `fused_ltx2_rms_norm_modulate` 的差异,理解 "bit-exact 可复用、非 bit-exact 需挂载门控" 的分级策略。

测试 重要性 7.00 洞察度 5.00

AMD nightly 补 GPT-OSS 性能基准,覆盖 MI30x/MI35x

建议精读两个新增测试文件与 `generate_simple_markdown_report`:一是看如何通过复用 accuracy 的 SERVER_ARGS 保证吞吐量归因正确,二是看 warmup 首行的约定如何与报告函数联动,三是记住多步骤 job 必须清理 `GITHUB_STEP_SUMMARY` 的教训。设计上最有价值的决策是“先建数据源、后设阈值”——不要在没有历史基线时硬编阈值。后续关注点:积累几周 nightly 数据后为两个 suite 补充吞吐量门禁。

性能优化 重要性 7.96 洞察度 6.00

DSA decode 跳过 indexer 的 k-only 快路径,吞吐提升约 5%

值得精读。核心看点有三:一是 CUDA graph 捕获期分支冻结这一深层约束下的解决思路——不在 capture 期按运行时 seq_len 分支,而是捕获 dense/sparse 两张图并在 replay 时由 host 分发;二是 `_resolve_dsa_variant` 优先复用 host 侧 `seq_lens_cpu` 镜像、避免每步 d2h 同步的性能细节;三是硬件 gating 的取舍——明确承认 CUDA 未验证并刻意保持原行为,值得作为跨平台共享代码变更的参考样本。若团队后续要支持 CUDA DSA 模型,建议先补齐 CUDA 上 DSA 模型的 decode 验证再摘除 `is_hip()` 门控。

参与讨论