Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-08-19
功能 重要性 8.69 洞察度 7.00

为 NIXL 后端接入延迟解码端 KV 释放的 ABORT_ACK 机制

值得精读,尤其适合负责 PD / KV 传输正确性的工程师。三个设计决策值得学习:① 用「出队时计数」构造静默判定(`Failed and outstanding == 0` 才可安全 ack)的并发推理;② decode 侧为什么必须用独立 ZMQ 线程而非 NIXL notif 消费 ack(`num_threads=0` 下 notif 没有独立进度线程);③ 异常路径故意不 ack、交给超时兜底的「宁可保守不冒险」取舍。建议先在小规模 NIXL 部署做一次 abort-mid-transfer 端到端验证,再在生产开启该特性。

#35071 [PD] Overlap prefill DP-rank bootstrap queries

原始 PR · 作者 YAMY1234 · 合并时间 2026-08-19 17:25

性能优化 重要性 7.13 洞察度 6.00

DP-rank 查询提前异步提交,decode 调度吞吐提升 1.36%

值得精读,尤其是对关注 PD 调度性能的工程师。核心看点是:如何在不改变权威结果语义的前提下,利用调度周期内已知信息与在途计算重叠;以及如何用测量数据(prefetch lead 时间、A/B 收益)驱动设计决策——删掉低收益的第二次 prefetch。建议结合 commit 历史(两个 commit 展示了从双 prefetch 到单 prefetch 的收敛)与 review 讨论一起阅读。

#35221 [HiCache] Support DCP with DSpark

原始 PR · 作者 kpham-sgl · 合并时间 2026-08-19 16:42

功能 重要性 6.13 洞察度 5.00

支持 DCP 与 DSpark 结合,并修复 host pool 尺寸问题

值得精读,尤其是 `hybrid_pool_assembler.py` 中关于逻辑索引空间的处理,以及 `server_args.py` 中参数兼容性的设计方式。

文档 重要性 4.15 洞察度 3.00

新增 SGLang Diffusion 融合算子文档页

值得快速浏览:fused_kernels 页首次公开了融合算子的完整清单和双数值契约,对使用 SGLang Diffusion 的用户和内核开发者都有参考价值。该 PR 本身无代码,但作为文档 PR 的质量标杆,其“从代码树派生表格并执行验证”的做法值得借鉴。

#34859 Qwen3.8-27B Model Support

原始 PR · 作者 yhyang201 · 合并时间 2026-08-19 16:31

功能 重要性 8.54 洞察度 6.00

新增 Qwen3.8-27B 支持,配套 FP4/FP8 GEMV 与修复

值得精读。重点关注三点:JIT GEMV kernel 的 dispatch predicate 设计(如何把收益集中在 DRAM 带宽受限的形状并安全回退 cuBLAS);FP4 融合中 scale 的 6-D swizzle 重排逻辑(极易出错但测试仅覆盖部分 batch);以及通过布尔标志 + 外部注入方式把融合能力局部化到 MLP / down_proj 的改动风格。

基础设施 重要性 2.42 洞察度 2.00

调整 MI355X 夜间调度时间为 07:00 UTC

无需精读。这是一次平凡的 CI 调度时间调整,内容简单直接。可作为理解 CI 工作流配置和团队协作方式的参考,但技术价值很低。

重构 重要性 8.86 洞察度 6.00

以显式能力契约门禁量化 encoder checkpoint,拒绝静默回退

值得精读。核心看点:以数据契约(CheckpointQuantizationCapability)替代文本 allowlist 的准入设计、fail-closed 策略与异常穿透(ComponentCheckpointUnsupportedError)的组合,以及“架构解析失败但有量化配置就拒绝、无量化配置就 fallback”的精细化分支。建议关注 _resolve_and_configure_encoder_quantization 的判定顺序与 component_loader.load() 异常链的后续演进。

基础设施 重要性 7.64 洞察度 4.00

base-c H100 CI 从 5 分片裁至 3,重排测试并清理死代码

值得 CI 维护者精读。本 PR 展示了基于 GPU 足迹与测试频率做 placement 的完整决策链:先算 `max_parallel` 量化收益,再逐文件核对真实 GPU 需求与 mock 依赖,最后用共享 mixin 消解跨文件复用冲突。需特别关注两点:`TestMTP` 删除带来的 dp2+MTP 覆盖缺口(建议后续在 extra 补回),以及新估 `est_time` 经 live partition model 校正后的分片稳定性。

参与讨论