Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58

PR 列表

更多筛选
2026-08-03
功能 重要性 8.66 洞察度 5.00

zigzag CP 预填支持 breakable CUDA 图

建议精读。该 PR 展示了“在已验证路径上安全放开 CUDA graph 互斥”的完整方法论:资格判断集中化(`supports_prefill_cp_bcg`)、固定地址缓冲 + 捕获容量校验(`PrefillCPBCGInput`)、以及 dispatch 边界的统一门控(`_prefill_cuda_graph_allows_context_parallel`)。值得关注的设计决策包括:不引入架构白名单而是依赖配置组合判断、replay 时对 CP 元数据做几何二次校验、以及将 eager logits tail 保留在图外。对于需要扩展其他 CP 策略(如 flashinfer / DSA)BCG 支持的团队,本 PR 的模块边界与错误处理模式可以直接复用。

#33347 docs: refresh README news highlights

原始 PR · 作者 merrymercy · 合并时间 2026-08-03 13:37

文档 重要性 2.44 洞察度 1.00

刷新 README 新闻亮点与采纳机构列表

值得快速浏览,了解 README 新闻区与机构列表的维护规范;由于是纯文档 PR,不建议精读,也无源码设计可供学习。

基础设施 重要性 4.82 洞察度 4.00

CPU CI 阶段改用实测分区模型动态扩容

值得 CI/基础设施维护者精读,核心看三点:一是把步骤 `timeout-minutes` 作为分区驱动信号而非硬性上限的“预算反馈”设计;二是 `_INLINE_SUITE_JOBS` 的硬失败策略,用显式错误替代静默降级;三是 CPU(托管、弹性)与 GPU(自托管、稀缺)在 `max_parallel` 节流上的差异化处理。若团队后续继续推进“实时分区模型”这条线,本 PR 的字段规范与读取逻辑是很好的参照。

文档 重要性 2.16 洞察度 3.00

修复 MiniMax-H3 页面质量表表头重叠

该 PR 属于琐碎文档修复,不值得精读,但可快速浏览了解处理 Mintlify 主题 `nowrap` 溢出的技巧:显式 `<br />` 配合保留空格以维持 `textContent` 不变,是一个可复用的小设计决策。

#33128 Support DeepGEMM for standard MoE dispatch

原始 PR · 作者 YAMY1234 · 合并时间 2026-08-03 12:48

功能 重要性 8.49 洞察度 7.00

补齐 DeepGEMM 标准 MoE 调度,新增紧凑布局与 UE8M0 重量化

值得重点关注的设计点:masked/compact 布局启发式与 CUDA Graph 静态 buffer 的权衡、padding 行用 expert index -1 跳过无效数据的技巧、以及 UE8M0 直接量化激活以避免 2x 误差的精度处理。建议性能团队以本 PR 为基线,针对 compact 布局的 block_e 对齐与 masked/compact 交叉点做专项调优;合并者已批准,注意跟进 EP 路径 kernel 参数变更对其他调用点的影响。

缺陷修复 重要性 5.54 洞察度 4.00

空字符串语法约束归一化为 None,修复 UnboundLocalError 崩溃

值得快速阅读。PR 很小但展示了两个值得借鉴的点:一是把“空值归一化”放在数据类构造入口,而不是散落到下游判断;二是选择链的分支条件必须与入口条件严格一致,避免 falsy 值与 is not None 之间的缝隙。可作为 API 参数边界处理的范例。

#33282 docs(diffusion): update skills for MiniMax-H3

原始 PR · 作者 BBuf · 合并时间 2026-08-03 12:44

文档 重要性 5.55 洞察度 4.00

更新 diffusion skills,新增 MiniMax-H3 T2VA 基准 preset

值得精读的文件为 `bench_diffusion_denoise.py` 的 `force_eager` 与 `artifact_dir` 设计,以及 `existing-fast-paths.md` 对 H3 数值契约的约束记录;其余为文档知识固化,可 skim。建议后续为该 preset 增加轻量单测或 CI 断言,避免文档与实际命令漂移。

性能优化 重要性 7.67 洞察度 6.00

ReplaySSM 环写融合进 GDN MTP verify 内核

值得精读,重点学习三处设计:一是条件分支的启用策略(backend x dtype x draft 长度三重条件),它限定了新 kernel 只作用于已验证的部署形态;二是 mixed-numerics 验证锚点设计——当两个 kernel 无法 bitwise 对齐时,改为让 Triton fold 消费新 kernel 写的 ring 并与其自身 committed state 对比,既验证了 ring 通道忠实性又避免了跨实现数值争议;三是 ring 作为纯旁路通道的契约(cache_ring 不影响输出,bitwise 断言保障)。阅读时可对照 test_gdn_cutedsl_ring_verify.py 的三条锚点与 gdn_backend.py 的分支逻辑,理解 spec decode 折叠机制对 kernel 侧通道的要求。

参与讨论