Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58

PR 列表

更多筛选
2026-08-26

#35314 Support deepseek v4 and kimi k3 on ssd

原始 PR · 作者 beyondHJM · 合并时间 2026-08-26 10:05

功能 重要性 9.36 洞察度 8.00

新增 SSD Expert Pack 加载,支持 DeepSeek-V4 与 Kimi-K3 超显存运行

值得精读。这是 SGLang 首次把 MoE 路由专家整体下沉到 SSD 的成熟实现,`ExpertPackStore` 的缓存/预取设计与完整 fail-closed 校验体系(identity 三元组、manifest 对账、stats 健康信号)有很高参考价值;review 中 BBuf 对"共享路径行为变化""参数校验聚合""校验成本与安全"的追问也值得学习。建议关注 pack 格式的版本演进、`gguf.py` 行为变化对非 expert-pack 模型的影响,以及 #36803 之后 `deepseek_v4.py` 的深层状态。

#36281 [Unified Cache]: add glm5.2 per commit ci

原始 PR · 作者 hzh0425 · 合并时间 2026-08-26 10:04

测试 重要性 7.55 洞察度 3.00

GLM5.2 缓存精度测试前移至每提交 CI,抽取双遍精度 Mixin

值得快速浏览,重点学习两点:一是如何通过 `register_cuda_ci(stage="extra-b")` 将模型级精度测试提升到 per-commit 阶段;二是把跨模型复用的测试逻辑抽到 `python/sglang/test/kits/` 的共享 Mixin 组织方式。对于需要新增 unified cache 相关精度测试的工程师有直接参考价值;不关心测试基建的读者可以跳过。

功能 重要性 6.81 洞察度 5.00

支持 Diffusion 模块自定义 torch.compile 后端与选项

值得精读,尤其是 build_torch_compile_kwargs 中 backend/options/mode 的互斥与回退逻辑,以及 Platform 基类“默认实现 + 可选覆写”的扩展模式。该设计低侵入、向后兼容,可为其他子系统的平台适配提供参考。

基础设施 重要性 4.53 洞察度 3.00

恢复 MiniMax-M2.5 MI35x 夜间 CI 任务

该 PR 值得快速浏览,但无需深入阅读。它展示了如何安全地恢复 CI 任务,并强调了在改动 CI 配置时进行逐字节对比和本地验证的重要性。

#36028 [docs] Add MiniMax H3 checkpoint format table

原始 PR · 作者 mickqian · 合并时间 2026-08-26 09:18

文档 重要性 4.75 洞察度 3.00

新增 MiniMax H3 checkpoint 格式总表,整合量化 CLI 文档

值得查阅但不必读代码:使用 MiniMax-H3 或 SGLang-Diffusion 量化时,这份表格是最新的格式-CLI 对照;文档维护者可借鉴“来源驱动表格 + 单一事实源 + 锚点复用”的结构。合并前建议回看 Extra CI 失败,并抽查删除行是否覆盖了 GGUF 等细节。

缺陷修复 重要性 7.35 洞察度 5.00

请求级 CUDA 内存池限制图像预处理显存,修复 VLM VRAM 增长

值得精读。该 PR 用最小改动解决了 VLM 长跑服务中容易被忽略的显存保留问题,核心技巧是请求级 `torch.cuda.MemPool` 作用域化分配,适合迁移到其他存在临时显存需求的预处理/后处理链路。

功能 重要性 9.18 洞察度 6.00

支持 Nemotron 3.5 Lightning DFlash/DSpark 推测解码

值得精读。该 PR 展示了如何以低侵入方式将新模型接入现有推测解码框架,尤其是"从 checkpoint 配置派生布局行为、避免新增 ServerArgs 开关"的设计决策,以及用结构检查保护通用路径的做法。建议关注 `dspark_config.get_dspark_sample_from_anchor` 的兼容策略和 `dflash._logical_linear_weight_shape` 的 packed 权重处理。

#36284 [CI] Add Kimi-K3 MMMU-Pro accuracy coverage

原始 PR · 作者 Fridge003 · 合并时间 2026-08-26 07:33

测试 重要性 7.47 洞察度 5.00

新增 Kimi-K3 B300 MMMU-Pro 精度 CI 覆盖

值得精读,尤其关注 `run_eval.py` 中 preset 与 legacy 参数分支的设计,以及 `MMMUProMixin` 的阈值校准方法论。对后续为其他推理模型添加 sgl-eval 评测有直接参考价值,也展示了如何通过实测数据驱动 CI 阈值设定。

参与讨论