Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58

PR 列表

更多筛选
2026-08-29
性能优化 重要性 6.41 洞察度 6.00

优化 HiCache 预取进度检查,减少不必要 all-reduce

该 PR 值得精读,尤其是对于理解 HiCache 在 PP/TP 下的同步机制,以及如何通过按需执行集合通信来优化性能。其设计决策(将 all-reduce 从公共路径中移出,仅保留在需要跨 rank 一致的 timeout 分支)具有借鉴意义。建议关注 `_can_terminate_prefetch` 上的 `rank_consensus` 装饰器的作用,以及未来可能对测试覆盖的补充。

#36433 [NPU] Update sgl-kernel-npu version

原始 PR · 作者 huangxiaojun15 · 合并时间 2026-08-29 00:42

基础设施 重要性 3.05 洞察度 3.00

更新 sgl-kernel-npu 版本至 20260826

该 PR 为常规维护性更新,值得快速浏览以确认版本号一致,无需深入精读。

基础设施 重要性 3.75 洞察度 5.00

拆分 JIT 内核单元测试为两个分区

该 PR 是 CI 基础设施的稳健性改进,值得快速合入。对阅读者而言,值得关注 `run_suite.py` 的自动分区机制(LPT 算法),作为后续类似 CI 优化的参考。若后续仍出现超时,可考虑增加分区数量或优化测试时长估算。

2026-08-28
基础设施 重要性 6.06 洞察度 5.00

新增 ROCm 10 发布镜像与 CI 流程,支持 gfx942/gfx950

值得关注 Dockerfile 中 rocm1000-base 阶段的 wheel-based 栈组装方式,以及发布工作流中按架构隔离 device wheels 的设计。这是基础设施演进,对 AMD 社区用户有实际价值,但不涉及核心算法,精读优先级中等。

#36827 [Docs] Add GLM-5.3 cookbook

原始 PR · 作者 Fridge003 · 合并时间 2026-08-28 22:56

文档 重要性 7.59 洞察度 4.00

新增 GLM-5.3 部署 cookbook,含多硬件实测数据

值得精读。虽然是文档变更,但它的数据治理方式很有参考价值:如何用 match 元组把 benchmark 与部署单元格绑定、如何用 verified/experimental/pending 表达数据可信度、如何用环境变量说明隔离“机制验证”与“正确性”数据。对部署工程师,建议直接使用 cookbook 中的 FP8 配方,但注意版本绑定与 NVFP4 的 Experimental 标注;对文档维护者,建议先同步 PR body 与内容的差异,并考虑为旧 benchmark 数据增加“于某版本失效”的提示。

功能 重要性 9.18 洞察度 6.00

新增 GLM-Image 分布式推理拓扑:AR 与 DiT 分角色 fan-out

值得精读。该 PR 展示了如何在既有 N:M:K 解耦编排器中并行走第二条 fan-out 调度模式:两段队列 + ThreadPoolExecutor 重叠 AR/denoiser、ZMQ monitor 驱动 worker 生命周期、n>1 拆分-顺序执行-合并的数据契约,都是可借鉴的设计。建议重点关注超时/断连恢复与共享 batch 属性访问的健壮性是否在后续 PR 中补齐,并为外部 AR 服务的 batching 语义变化补充回归基线。

参与讨论