Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-08-19
性能优化 重要性 6.15 洞察度 6.00

HiCache PP 合并写入与加载完成同步,一次 all_reduce 替代两次,吞吐提升 37%

值得精读,尤其关注其设计取舍:用单次向量化 all_reduce 替代两次独立同步,并用 ReduceOp.MIN 保证跨 stage 安全推进;同时明确拒绝合并 storage 队列同步以维持 PP storage 语义。测试构造技巧(`object.__new__` 绕过 `__init__` + MagicMock 精确断言)也值得借鉴。

性能优化 重要性 5.61 洞察度 4.00

恢复 SM10X 路由 GEMM 阈值至 16,EAGLE 重回 JIT 快路径

值得快速阅读 PR body 的 benchmark 方法论:它演示了“阈值调优必须与被测量 fallback 绑定”的教训,以及 speculative decoding 下 M 的放大效应。改动本身只是字面回退,建议合入后关注 Extra CI 失败是否残留。

功能 重要性 8.95 洞察度 7.00

MiniMax-H3 SubBlock 稀疏注意力从 SM100 扩展到 SM90,Hopper 端到端提速最高 2×

值得精读。这是“同一路由方案、双 kernel 后端”的教科书式实现:重点看 (1) `_get_subblock_sparse_attention_runner` 的按设备一次性缓存分发,避免热路径开销;(2) `_sm90_sparse_attention` 中显式排序与 `None` full-block 的推理链条——为何排序是正确性的前提、为何 `None` 比空张量更优;(3) `block_sparse_utils.py` 的编译期守卫,区分“运行时值”与“编译期常量”是 CuTe DSL 调试的高频难点;(4) `_tile_size_fwd_sm90` 的 64×64 特例边界。Review 讨论本身也具有很高的学习价值,特别是对 kernel 内部消费顺序契约、compile key 隐式依赖的识别。

缺陷修复 重要性 7.26 洞察度 6.00

H3 AdaLN 缓存重建改事务性发布,修复重置与失败两条路径

值得精读。核心价值不在代码量而在设计决策:缓存元数据的发布时机决定了失败后的可重试性,事务性发布把“部分完成”状态对后续请求隐藏。建议重点关注两点:一是容量重置时按 wanted 而非 missing 重建的语义选择;二是 plan_lengths 与 _slots 的提交顺序这一不变式。对想为 diffusion 缓存补状态类测试的开发者,测试文件中的 _online_cache、_write_online_weights 辅助函数是可直接复用的模式。

功能 重要性 9.36 洞察度 7.00

为 HiCache 引入缓冲区模式,将主机内存用作 GPU 与存储之间的临时暂存区。

这个 PR 值得仔细精读,特别是 `buffer_mode/pipeline.py` 和 `unified_radix_cache.py` 中的集成逻辑,它们清晰地展示了如何在不破坏现有功能的前提下,通过策略分支引入一个全新的操作模式。关键的设计决策包括:将主机内存用作临时缓冲区而非缓存层、使用存在性缓存去重写操作、以及设计严格的模式验证规则。尽管存在附带的行为变更和未接线的组件,但整体架构设计清晰,动机明确,解决了实际痛点。建议关注作者承诺的后续重构(将组件特定逻辑分离)和未接线组件的最终状态。

重构 重要性 9.18 洞察度 6.00

Qwen 视觉与文本模块复用 SRT 原语,去重千行

值得精读。该 PR 展示了跨 runtime 复用的边界设计:通用原语下沉到 SRT,而 attention 与量化这类与 runtime 契约强耦合的模块留在 MMGen;同时以数值保真测试和两卡折叠校验保障重构安全。建议重点关注三处:`Qwen2_5_VLMLP` 的 TP 三段式选型、`RMSNorm` 高阶 residual 的 flatten/restore 逻辑、以及 TP group 绑定/恢复的生命周期管理。

#12961 Fix DP attention on CPU

原始 PR · 作者 chunyuan-w · 合并时间 2026-08-19 09:56

缺陷修复 重要性 7.79 洞察度 6.00

CPU 引擎 DP 注意力功能修复,含 MoE 归约与拷贝路径

值得精读。该 PR 展示了“先参考实现保功能、再提交优化 kernel”的跨平台适配策略,且 review 中关于循环导入、hasattr 误判、全局函数分发的讨论有实际工程借鉴价值。对 CPU 平台维护者尤其有参考意义,建议关注后续 sgl-kernel 对 `memcpy_cpu`、`reduce_scatter_tensor`、`all_gather_into_tensor` 的替换。

参与讨论