Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-08-22
性能优化 重要性 7.56 洞察度 6.00

CPU 启动的 VAE 权重保留文件映射,显著释放主机内存

值得精读。核心看点:一是 file-backed 映射与匿名内存的取舍——匿名页无法被 page cache 回收,而映射首次使用要付缺页,门控以“整个部署权重 vs 可用主机内存”为决策基准而非单个组件;二是 `_match_checkpoint_dtypes` 把“必须拷贝的张量”精确限定为 dtype 不匹配者;三是 CI 性能基线如何推动设计修正。若要借鉴此模式,可关注瞬时内存测量与统计口径的边界情况。

重构 重要性 5.76 洞察度 4.00

修复 Granite sinks dtype 读取,改用 exec bag

值得快速浏览,因为它是清除 legacy 全局 shim 的系列改动之一,且为后续修复 split launch dtype 问题埋下了 TODO。可以关注 `granite.py` 和 `gpt_oss.py` 的一致性,以及未来针对 split launch 的修复。

性能优化 重要性 7.98 洞察度 7.00

RAGGED prefill top-k 切换至 v2 JIT 内核,extend 提速 1.3-1.8×

值得精读。该 PR 是 CUDA kernel 性能优化的优秀样本:`bias` 字段配合编译期折叠实现零开销接口扩展;in-place 掩码把未对齐窗口的代价压到最低;测试用哨兵分数让任何窗口外泄漏立即暴露。建议重点阅读 `topk_v2.cuh` 中 `topk_ragged_kernel` 的注释论证、`dsa_topk_backend.py` 的 dispatch 条件,以及 `test_topk_v2.py` 的 `OUTSIDE_SCORE` 设计与写范围断言。合并前需确认 AMD ROCm CI 失败是否为既有 known failure。

功能 重要性 7.19 洞察度 5.00

DSV4 FP4 检查点自动选 FlashInfer MXFP4 MoE runner

值得精读。重点学习两点:一是「自动默认值」的 fallback 条件设计——平台、架构白名单、A2A 模式、反量化环境变量、显式用户选择逐层让位,避免默认值吞噬用户意图;二是单元测试的矩阵化写法,用 `patch.object` 逐项钉住每个 fallback 分支。FP4 + DeepEP/A2A 用户应验证自己的启动组合是否仍可用。

#35239 Rainj me/rust server refactor2

原始 PR · 作者 rainj-me · 合并时间 2026-08-22 07:37

重构 重要性 9.36 洞察度 6.00

重构 Rust Server 模块,配置改为强类型传递

值得精读。重点看 message/config.rs 的 pyo3 强类型配置模式——它把 Python↔Rust 边界从“字符串 blob + serde 解析”升级为“类型化构造 + 编译期校验”,是消除运行时错误的典型案例;同时可学习其模块拆分方式,理解 Rust server 后续演进结构。

文档 重要性 3.24 洞察度 4.00

cookbook 安装命令统一加 --prerelease=allow

不值得精读代码(本 PR 无代码),但值得完整浏览其 PR body——它是一份高质量的"文档类缺陷修复"范本:有根因分析、可复现的度量数据(`uv pip compile` 对比表)、显式的排除清单和最终验证手段(`git grep`)。对维护者:建议跟进 #35912 的 packaging/runtime guard,从包层面让静默降级不可能发生;同时可按环境指纹(0.5.9 + 对应 torch pin + uv 0.11.x)重新分类 #24029 等 6 个旧 issue。

#35210 docs: add website link to README header

原始 PR · 作者 alisonshao · 合并时间 2026-08-22 06:50

文档 重要性 1.20 洞察度 1.00

README 导航新增官网链接,改善官网可发现性

无需精读,属于零风险文档合并。值得借鉴的点是:将主站链接纳入 README 头部导航以改善 SEO 与用户入口,该低成本做法适合在其他子项目 README 中推广。

性能优化 重要性 6.47 洞察度 6.00

Qwen 共享专家与 DeepEP 路由专家重叠,吞吐提升约 2%

值得精读,特别是对 MoE 性能优化感兴趣的工程师。关键设计决策包括:使用备用流重叠共享专家与路由专家,通过事件实现同步,以及针对可断点 CUDA 图的回退策略。建议关注后续是否补充单元测试。

参与讨论