Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 22:27 同步状态:空闲 下次计划:2026-09-03 23:27

PR 列表

更多筛选
2026-08-02

#33100 [CP]: FIx some issue for glm5.2 cp v2

原始 PR · 作者 hzh0425 · 合并时间 2026-08-02 04:50

缺陷修复 重要性 6.31 洞察度 5.00

修复 GLM 5.2 DSA 模型 CP-v2 三处缺陷

值得精读。对推理引擎开发者,重点看 dsa/utils.py 的 cal_padded_tokens 与 dsa_backend.py 的 _forward_trtllm:它们清楚展示了 CP-v2(interleave 分片)与 legacy CP(split-and-rebuild)在位置语义与 padding 语义上的差异,以及如何用 is_cp_v2_active 做双路径兼容。对使用 GLM 5.2 + prefill-cp 的用户,建议在 MTP 场景观察行为并关注后续修复;对 SGLang 维护者,建议为本 PR 补充针对 per_rank_actual_token 初始化顺序的单元测试。

#33130 Disable breakable CUDA graph for NemotronH

原始 PR · 作者 b8zhong · 合并时间 2026-08-02 04:48

缺陷修复 重要性 6.02 洞察度 4.00

禁用 NemotronH 的 BCG 规避 prefill 重放精度波动

建议快速精读这一段集中式 BCG 兼容性规则表,它展示了 sglang 如何处理模型级捕获缺陷:先切配置期开关止血,再做根因修复。当前应优先与 elvischenv 确认 main 上的修复是否已覆盖 NemotronH 三个架构并补一个回滚 PR,同时补上 GSM8K 波动回归测试,避免再次踩坑。

#33026 [rust-server] fix TCP-layer TTFT stalls

原始 PR · 作者 sherlockwu · 合并时间 2026-08-02 03:13

性能优化 重要性 6.71 洞察度 7.00

修复 Rust server TCP 层两类 TTFT 卡顿

值得精读,尤其适合服务器网络编程与性能调优场景。三个值得关注的设计决策:1) 诊断先行——先用 raw-socket 探针和内核计数把问题量化到 TCP 层,再动手改代码;2) 用 tokio 原生 API(TcpSocket)而非手写 libc,降低 unsafe 面且生命周期管理更简单;3) 启动语义权衡——bind 保持同步(端口冲突是硬错误),listen 移到运行时(失败软降级),配置失败不阻断启动。建议后续补一个 raw-socket 大包探测的自动化测试或 CI 探针,防止这两类 TCP 行为悄悄回归。

性能优化 重要性 5.83 洞察度 7.00

flashinfer_deepgemm FP8 GEMM 限定在 1 <= M < 32

值得精读。这是一个小改动但论证极其扎实的 PR:用微基准、准确率实验、路由矩阵和失败模式分析支撑一个 20 行改动,并诚实地划清“性能论据为主、准确率论据为辅”的边界。值得关注的设计决策包括:单一 triton 出口折叠 M 检查、DeepGEMM 自行兜底、以及因为 DeepEP 交互问题主动回退 auto 默认。对做 kernel 调度和后端选择的工程师尤其有参考价值。

文档 重要性 4.93 洞察度 7.00

重写 runtime-context 技能文档,适配 namespace-bag 配置模型

值得精读。这份 PR 是理解 SGLang 新配置架构(RuntimeContext + namespace bags)最直接的入口,尤其适合配置系统维护者和经常被 agent 改动波及的模块 owner。重点看三处:tier 表中 raw config seed 与 resolved config 的职责切分、"Reads that legitimately stay on a ServerArgs instance" 章节(per-runner / per-instance 边界)、以及护栏清单(writer ratchet、namespace-coverage lint、migration-deferral ratchet)。整个 review 交锋过程本身就是一份"配置模型迁移边界情况清单",比正文更有学习价值。

2026-08-01
重构 重要性 8.38 洞察度 7.00

配置读取按角色强约束,三模式审计与 fail-closed 落地

值得精读。这是 config-namespace 重构系列的关键拼图,展示了三个高价值设计决策:①用"单条可剪枝比较 + 外联检查"在默认路径上兼容 dynamo fullgraph 捕获;②record/enforce 两阶段 rollout——先审计后约束,且审计数据即时持久化以对抗信号杀进程;③fail-closed 的防御纵深(publish 时校验 + 读取时再防御)。建议结合 #33011 / #33012 / #33013 及 base PR #33171 一起阅读,理解完整演进脉络。

测试 重要性 6.93 洞察度 6.00

恢复配置迁移期跳过的 15 个单测文件,退役 deferral ratchet

值得精读。两类读者收益最大:(1) 正在做大规模内部 API 迁移的团队——deferral ratchet(钉住基线 + 双向断言)是管理迁移测试债务的极佳实践,本 PR 展示了它的完整生命周期(建立、履行、退役);(2) SGLang runtime context 相关开发者——本 PR 是 `override_server_args`、bag 断言、各命名空间访问器用法的活教材。radix cache 用例的改造尤其值得看:它展示了当测试在“跳过期”长大、且与生产语义发生冲突时,如何重新构造等价状态而非强行适配。

重构 重要性 7.67 洞察度 6.00

并行配置读取全量迁至 get_parallel(),弹性 EP 写路径改走 override

值得精读。三个设计决策值得学习:(1) 访问器慢路径保持 dynamo 可追踪——graph-break 是编译路径上的隐性炸弹,用 _fields 字典判断和槽位直读替代 __getattribute__;(2) live-shadowed 拓扑尺寸原则——活属性优先于 bag,避免"同一名字两个值"的歧义;(3) ratchet 机制让跨 80+ 文件的迁移可以被机械验证。对要扩展 SGLang 配置体系、或编写 torch.compile 兼容代码的工程师都有参考价值。

参与讨论