Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-08-06
性能优化 重要性 6.94 洞察度 6.00

PD 下启用 fused DSA TopK,TPOT 降约 3.3%

值得精读。核心设计是“wire 表示不变、消费端一次性重映射”,这是跨 allocator 数据交换的经典模式,且通过 `should_remap_pd_dsa_seed_to_local_slots` 一个符号集中了全部可扩展门控。重点看:五重门控的条件选择、`invalid_rows` 的 fail-closed 语义(哨兵、越界、未分配 slot 三类校验)、以及 CI 上 e2e 多次 flaky 的处理方式;后续可关注 ROCm 侧提交的 fused TopK 扩展 PR。

#32388 Observability enhancement for HiCache

原始 PR · 作者 xiezhq-hermann · 合并时间 2026-08-06 05:13

功能 重要性 8.83 洞察度 5.00

HiCache 新增分层命中、备份回载与丢弃指标

值得精读。重点关注三类设计:1) `HiCacheAck` 同时携带按 pool 的 token 数与总字节数,让带宽计算和分池监控只依赖 ack 快照;2) `make_timing_event_pair()` 与设备端事件的配合,使 backup/load-back 耗时统计避开调度器同步噪声;3) 新旧缓存路径共用 `_log_write_ack_metrics` 的接入方式。建议结合 PR #33580(统一树核心接口)一起阅读,理解 UnifiedRadixCache 对旧缓存路径的替代进程中观测性如何保持对齐。若团队在用 write-back 策略,可基于新指标建立丢弃率与 L2 带宽告警。

基础设施 重要性 7.92 洞察度 6.00

将第三方编译内核缓存统一到 SGLANG_CACHE_DIR 下

值得精读。该 PR 展示了如何在大型推理框架中干净地整合多个第三方 JIT 缓存的生命周期,关键设计包括:`setdefault` 尊重用户显式覆盖、用 callable 默认值延迟解析依赖顺序、把默认值映射抽成单一数据源供多模块复用,以及通过 review 发现并修复 diffusion 缓存隔离与 CI warmup marker 漂移等问题。需要关注 `redirect_third_party_caches()` 的调用时机约束(FlashInfer 导入前、Inductor 首次 `cache_dir()` 前),以及 @ch-wan 提出的 diffusion 缓存隔离方案,可复用于类似的多缓存管理场景。

性能优化 重要性 9.36 洞察度 7.00

对齐 WAR 栅栏与图元数据读取,覆盖 prefill 与 spec decode

值得精读。该 PR 展示了如何用『图内事件节点 + 策略枚举 + 算法能力接口』把 CUDA graph 的同步边界精确对齐到读取发生点,是理解 SGLang overlap scheduler 与 WAR 屏障机制的关键案例。可重点关注 _war_read_done_policy 的优先级判断和 make_war_read_done_event 的外部事件用法。

#31491 Feat/spectrum

原始 PR · 作者 LeonHibnik · 合并时间 2026-08-06 04:23

功能 重要性 9.18 洞察度 7.00

新增 Spectrum 跳步加速,Flux/Wan/Hunyuan 去噪提速 3-5x

值得精读。设计亮点包括:Chebyshev 岭回归 + 局部 Taylor 混合预测(w 参数)、无 LAPACK/MAGMA 构建下的纯 Python Cholesky 回退、`get_total_forward_steps` 对 CFG 分支计数语义的精确建模、以及"显式门控避免污染编译图"的工程纪律。评审中 alexnails 对 SD3 真 CFG 双分支污染的深度分析(含数据流推导)尤其值得学习。建议阅读时重点关注 spectrum.py 的 forecaster 生命周期与 4 个模型 forward 的门控模式,可作为后续接入新 DiT 模型的参照。

基础设施 重要性 7.72 洞察度 6.00

新增 srt_empty 安装组,支持非 NVIDIA 平台免 torch 安装

值得精读。核心看点有两个:一是用“配置拆组 + 契约测试”替代 vLLM 动态 setup.py 方案的依赖治理模式;二是核心模块顶层 CUDA/Triton 导入的惰性化改造(TYPE_CHECKING、try/except、None 守卫)如何在保持运行时行为不变的前提下扩展安装面。建议关注两项已记录的遗留事项:uv pip compile 传递依赖 CI、FLA_CHUNK_SIZE 抽取共享常量文件;未来合入涉及 scheduler.py、server_args.py 的 PR 时注意与本 PR 导入区域的交互。

测试 重要性 7.67 洞察度 6.00

折叠重复测试套件,5090 CI 减时约 580 秒

值得精读。该 PR 展示了 CI 优化的典型思路:识别重复启动服务器的测试、用 mixin 复用测试方法、矩阵削减保留边界覆盖、基于实测校准预估。对于维护大型 CI 矩阵的团队有借鉴意义。重点关注 `kits/` 下的 mixin 设计和 `test_retract_decode.py` 的对角线削减逻辑。

#33459 [Spec] Support logprobs with DFlash

原始 PR · 作者 jvmncs · 合并时间 2026-08-06 03:37

功能 重要性 6.11 洞察度 4.00

DFlash 推测解码支持 return_logprob 请求

值得快速阅读。改动小但覆盖了 admission 控制、worker 验证路径和测试复用,是 DFlash 功能扩展的一个清晰范例。重点关注 `compute_spec_v2_logprobs` 的调用时机和 `output_indices` 的构造方式,以及 scheduler 中对 DFlash/DSPark 的差异化处理。

参与讨论