Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51

PR 列表

更多筛选
2026-08-27
基础设施 重要性 4.68 洞察度 5.00

修复 XEON CI 失败:SPR 容器重构、缓存挂载、AMX 参数调整

值得 CI/基础设施维护者精读。重点学习:如何根据 sglang 的内存预留机制(psutil 读宿主内存、cgroup 不生效)推导出容器编排方案;以及 review 如何通过 "hiding the real dependency" 的判断把一次不正确的测试补丁拦截下来并最终回退。对 DeepSeek V4 共享专家融合逻辑感兴趣的人,可关注 get_parallel().override(moe_ep_size=1) 这个测试辅助模式的用法。

性能优化 重要性 6.68 洞察度 5.00

调度器元数据改用固定内存,解锁异步 H2D 拷贝

值得精读。该 PR 是调度器重叠优化的基础性改动,展示了 `pin_memory` 与 `non_blocking` 搭配使用的关键细节:只有源数据本身在固定内存中,non_blocking H2D 才能避免 CUDA 内部同步 staging。建议同时关注 #34515 的完整实现,并留意 `_make_num_token_non_padded` helper 的抽取方式——它统一了多个调用点的构造逻辑,是后续扩展 pin 内存覆盖面的可借鉴模式。

文档 重要性 5.91 洞察度 4.00

为 GLM-5.3-Flash 新增 AMD ROCm 部署配方

值得快速阅读的文档型 PR。它展示了如何在 cookbook 配置面板中为未验证平台保留入口但禁用危险组合,并在基准数据中严格区分验证与推断、准确性测量与性能声明;对后续新增硬件配置和维护文档纪律有参考价值,无需深读代码。

缺陷修复 重要性 5.69 洞察度 6.00

修复 AITER 草稿扩展注意力 int32 溢出

建议精读此 PR,尤其是 PR 描述中关于问题定位和验证的部分。它展示了如何通过系统性的性能分析和精确的实验设计来定位一个看似是批处理大小问题、实则是数据类型溢出的隐藏 bug,对于调试类似的静默性数值问题很有参考价值。

性能优化 重要性 8.36 洞察度 6.00

DSV4 目标预填充提前发布共享读完成事件以提升重叠调度

值得精读。该 PR 是投机解码调度重叠的重要一环,展示了如何通过“提前快照共享读 + 声明 PRE_REPLAY 边界”来安全地放宽 WAR 屏障,对理解 DSV4 的 sparse prefill 数据流和 CUDA graph 元数据生命周期有直接帮助。建议结合 #34816 和 #34515 一起阅读,把握完整的调度重叠演进路径。但需关注合并后 CI 回归的修复情况,确认 `token_to_kv_pool` 问题已解决后再合入主线。

#36609 [CI] Grant no-cooldown for UNIDY2002

原始 PR · 作者 UNIDY2002 · 合并时间 2026-08-27 12:14

基础设施 重要性 2.60 洞察度 1.00

为 UNIDY2002 取消 CI 冷却时间

无需精读,属于常规配置调整。可关注后续是否有其他贡献者获得类似权限。

#35416 docs: sync LMSYS SGLang blog cards

原始 PR · 作者 sglang-bot · 合并时间 2026-08-27 11:56

文档 重要性 3.69 洞察度 2.00

自动化同步 LMSYS 博客卡片内容

无需精读。作为自动化文档同步的 PR,值得注意 bot 的自动化流程,但对技术学习无实质价值。

参与讨论