Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-08-07
缺陷修复 重要性 5.77 洞察度 6.00

修复 Triton 后端 PP 下 v_head_dim 越界崩溃,解除 XPU 生产阻断

值得精读。这个 PR 虽小,但揭示了两个重要设计约束:一是 PP 下所有「以 layer 0 为锚点」的初始化逻辑都应改为 start_layer 锚定;二是注意力内核的维度必须来自 buffer 实际布局而非 model config(MLA 的 kv_lora_rank 与 head_dim 不一致)。建议后续补一个 PP + Triton 后端的单测,并排查仓库内是否存在其他写死 0 的同类查询。

缺陷修复 重要性 7.75 洞察度 7.00

/health 门控 warmup,新增 /liveness 区分存活与就绪

值得精读。该 PR 展示了一个经典的微服务健康检查语义拆解案例(liveness vs readiness),并解决了由端点语义混用导致的启动死锁问题。关注点:/health 门控的实现方式、内部探测为何必须切换 /liveness、以及文档中对 warmup-mode 行为差异的说明。

功能 重要性 9.18 洞察度 6.00

新增 LoRA 支持的 30B MoE 文生视频模型,复用 fused_experts

值得精读。核心设计决策:1)直接复用 srt `fused_experts` 而非在 diffusion 侧自研 MoE GEMM,注意 `gate_up_interleaved`/`inplace`/`routed_scaling_factor` 三个对齐上游语义的关键开关;2)fp32 敏感模块清单 `LINGBOT_VIDEO_FP32_MODULES` 与 `should_keep_in_fp32` 的精度管理方式;3)热路径优化教训——权重打包一次加载、RoPE 设备端一次构建、B>1 合并为单次 batched attention;4)srt TP group 桥接的权宜设计及其后续框架级替代方向。阅读顺序建议:先看 `runtime/layers/moe.py`,再看 `lingbot_video_moe.py` 的 attention 与 position ids,最后看 pipeline 组装。

重构 重要性 7.26 洞察度 6.00

Ring 准入改为后端能力自声明,去掉两处白名单

值得精读。改动虽小,但把“能力自声明优于调用点白名单”的模式再次落地(与 #33707 一致),并演示了如何用单元测试锁住类级能力与字符串级配置的一致性。对要新增 diffusion 注意力后端、或想理解 USPAttention gate 演进路径的同学有直接参考价值;同时也提示接入新后端时务必同步覆写 `supports_ring_rotation()` 并补一致性测试。

性能优化 重要性 6.65 洞察度 5.00

Qwen masked 注意力元数据改 host 侧构建,消除每步 GPU 同步

值得精读。改动仅 57 行,但展示了两个有价值的工程决策:一是复用已有信息(txt_seq_lens)消除不可避免的 GPU 同步,二是从被否定的较大方案(#31852)中剥离出独立成立的小改进并单独合入。实现层面建议关注 `build_varlen_mask_meta_from_ranges` 的契约与分支条件完备性,未来可补充基准数据验证收益量级。

测试 重要性 6.36 洞察度 3.00

SWA chunk-cap hatch 测试迁入 CI 注册套件

这是一个纯测试迁移 PR,代码量小、逻辑清晰,适合快速浏览。值得关注的点是:`_swa_req_never_fits` 门卫的语义(什么条件下才允许走 `_swa_chunk_cap` hatch)以及用真实 `PrefillAdder` fixture 替代手工拼接的测试改进方式。不建议深度精读,但可将其作为 SWA 调度测试组织的参考。

文档 重要性 3.86 洞察度 2.00

Ascend 文档升级至 v0.5.16,GLM-5.2 切换稳定镜像

无需精读源码逻辑,但值得浏览 glm_5_2.mdx 的镜像切换和 qwen3_6_35b_a3b.mdx 中移除 NEXTN 失败警示的文案,体会版本发布后文档同步的流程。若你维护 Ascend 相关部署脚本,需要注意镜像标签命名约定已从 v<SGLang>-cann<CANN> 变为 cann<CANN>-v<SGLang>。

性能优化 重要性 8.05 洞察度 6.00

Z-Image qk-norm 融合 Triton 内核,e2e 提速 6.4%

建议精读。核心看点:(1) 如何用 Triton 逐位复刻 aten 归约顺序(vec8 lane 串行累加 + shfl-down butterfly)并做到 `torch.equal`;(2) 融合过程中吸收 `.contiguous()` 物化的设计,把 q/k 拷贝开销消掉;(3) 运行时自检从引入到移除的权衡——先以进程级安全网验证可行性,再收敛为单元测试契约。维护时重点关注 bit-exact 契约对 aten 实现细节的依赖程度,以及测试用例是否足以在 aten 变更时及时暴露回归。

参与讨论