Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51

PR 列表

更多筛选
2026-06-20
缺陷修复 重要性 6.80 洞察度 7.00

修复实验 LoRA 多适配器正确性与 flashinfer 0.6.12 兼容

此 PR 值得精读,尤其是双流重叠的设计权衡和 CUDA 图捕获的保护策略。展示了如何在不破坏性能的前提下修复并发正确性 bug。对于使用实验 LoRA 路径的团队必须合入,对于其他开发者可作为 CUDA 图安全的参考。

性能优化 重要性 9.18 洞察度 7.00

sgl-router 入口处 tokenize 一次并复用,消除引擎侧重复 tokenization,最高降低 41% TTFT

本 PR 设计质量高,将 tokenize 解耦并安全转发至引擎,强烈建议精读 `input_ids_safe_to_forward` 和 `request_tokens_for` 的实现。特别是安全守卫的谓词设计值得参考——它明确枚举了所有不支持转发的情况,未来需持续维护。对于自定义模板等新兴场景,建议建立类似 PR 流程确保安全扩展。

缺陷修复 重要性 5.61 洞察度 4.00

修复 DummyModelLoader 执行顺序导致 BailingMoE 启动崩溃

该 PR 变更清晰、修复明确,值得快速合并。虽然改动简单,但揭示了模型加载器中不同 `post_load_weights` 实现的隐含假设,建议为 DummyModelLoader 添加简单的维度检查测试,以防止未来类似回归。

基础设施 重要性 6.44 洞察度 4.00

路由器请求体上限 1 MiB 提升至 5 MiB

该 PR 设计清晰、改动集中,值得精读以了解路由器限流和可观测性配置。特别是测试改用对配置常量的引用而非硬编码数字的做法值得学习。

基础设施 重要性 5.29 洞察度 4.00

新增4GPU AMD MI35x runner,缓解8GPU饱和

建议阅读:该 PR 展现了如何通过 CI runner 标签细化来缓解资源竞争,是典型的 CI 可观测性与成本优化实践。值得关注的是命名约定、套件拆分策略以及如何平衡覆盖与资源效率。

#28738 [CI] Publish 4-GPU nightly profiler traces

原始 PR · 作者 mmangkad · 合并时间 2026-06-20 06:27

基础设施 重要性 4.16 洞察度 2.00

4-GPU 夜间 CI 新增 trace 发布步骤

变更简单直接,无需深度 review,但值得关注的是团队如何通过 CI 自动化实现可见性提升。如果正在配置类似流程,可参考 `publish_traces.py` 和 `PERFETTO_RELAY_URL` 的使用方式。

参与讨论