Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 19:08 同步状态:空闲 下次计划:2026-09-01 20:08

PR 列表

更多筛选
2026-08-27
缺陷修复 重要性 4.53 洞察度 4.00

radix_cache 测试夹具改优雅关闭,修复 H200 CI GPU 未空闲失败

实现机械,无需逐文件精读,但值得快速浏览 PR body 的根因分析和统一替换模式。对于维护多 GPU 测试夹具的工程师有参考价值:服务器进程应统一采用“先 SIGTERM 等待、再 SIGKILL 兜底”的关闭方式,让 CUDA context 在用户态释放,而不是把显存回收留给驱动异步处理。建议关注 wait_timeout=60 与 idle 门控 30 秒的取值关系,以及该模式后续是否应推广到 radix_cache 目录之外的其他多卡测试套件。

功能 重要性 8.62 洞察度 7.00

VLM 预处理池按路径动态调 worker 数

建议精读。该 PR 是“用真实测量驱动默认值决策”的典范:同一份代码在 H200 与 GB300 上得出相反的并发结论,最终以路径区分取代无条件默认。同时暴露并修复了 deepcopy 时机、闭包方法绑定、AST 审计等并发细节陷阱,对维护多模态推理栈的工程师有很高的借鉴价值。值得重点关注 `base_processor.py` 的路径决策函数与 `executor.py` 的懒克隆设计。

#36639 [CI] Fix Q8KV8 sparse prefill test fixture

原始 PR · 作者 nvpohanh · 合并时间 2026-08-27 16:00

测试 重要性 3.30 洞察度 3.50

修复 Q8KV8 稀疏预填充测试夹具

值得快速浏览,了解测试夹具与后端重构的耦合关系。建议关注后续是否还有其他测试需要类似调整。

缺陷修复 重要性 8.01 洞察度 6.00

修复 adaptive 投机解码启动崩溃并削减 CUDA graph 内存

值得精读。该 PR 展示了三个可借鉴的设计决策:① `max_decode_logits_rows()` 从「单宽度静态定容」改为「遍历全部 candidate 宽度取最大值」,消除配置解析与 buffer 分配之间的不一致;② warmup hook 必须从 capture 实际使用的 backend 解析,任何依赖 `model_runner` 全局状态的捕获逻辑在 adaptive 多 runner 场景下都不可靠;③ 利用 CUDA caching allocator 按 stream 分区 graph pool segments 的特性,通过进程级共享一条 capture stream 让后续 pass 复用前次留下的 inactive scratch,这是理解 CUDA graph 内存复用的关键机理。建议后续跟进两个点:共享 stream 的串行前提是否有运行时断言保护,以及 IMA 修复是否值得补一个端到端 GPU 回归用例。

#36636 [AMD][CI] Add targeted Mori test labels

原始 PR · 作者 inkcherry · 合并时间 2026-08-27 15:24

基础设施 重要性 5.42 洞察度 4.00

新增 run-mori-pd/run-mori-hicache 标签门控 AMD CI 测试

建议 CI 维护者与 AMD 相关开发者精读,重点关注标签门控与 workflow_dispatch 双通道触发、labeled 事件不取消进行中任务这两个设计点;对一般业务开发者价值有限。落地前需确认仓库标签已创建,并观察首个标签 PR 的 runner 调度与 RDMA 环境是否按预期工作。

性能优化 重要性 7.93 洞察度 6.00

gfx950 新增 MTP 专用注意力内核,提速约 2 倍

值得精读。该 PR 展示了如何针对特定硬件和形状手写 Triton 内核并通过形状门控安全接入,review 中关于 TP1/TP2 兼容性的讨论也体现了对通用性的思考。关注 `unified_attention_3d_mtp_func` 的 launch 配置和 `aiter_backend.py` 的门控条件,对理解 AMD 内核优化和投机解码加速有参考价值。

基础设施 重要性 6.47 洞察度 5.00

XPU CI 新增 multimodal_gen 触发与 24 GiB 适配扩散套件

值得精读,重点看 gpu_cases.py 中"平台能力差异驱动的测试分层":如何按显存预算从共享用例池中裁剪平台子集、如何用 `_select_xpu_cases` 避免用例定义漂移、为何必须原地 mutate `ONE_GPU_CASES` 才能让 pytest 参数化生效。对 CI 维护者而言,路径过滤器与 pr-gate 的 `changes_exist` 兜底设计、perf baseline 播种流程都可直接借鉴。若关注 XPU 扩散推理,denoising.py 的 None vs [] 修复也是 diffusers 集成的一个典型坑。

#36198 [Weight Cache] Enhance test and support EPLB

原始 PR · 作者 UNIDY2002 · 合并时间 2026-08-27 14:11

功能 重要性 6.88 洞察度 5.00

weight cache 放开 EPLB 限制并补齐 DP/EP 测试

值得精读。核心看点是 daemon 与引擎通过 `compute_initial_expert_location_metadata` 共享同一 EPLB 布局初始化入口,以及测试基类用类属性参数化 daemon/server 参数的模式。关注 weight cache 功能线的读者建议结合 #33684 和 #34053 一起阅读,理解从 TP-only 到 DP/EP/EPLB 全覆盖的演进路径。

参与讨论