Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 21:57 同步状态:空闲 下次计划:2026-09-02 22:57

PR 列表

更多筛选
2026-08-20
基础设施 重要性 4.68 洞察度 4.00

AMD 夜间 CI 同时跑 ROCm 7.2.4 与 7.2.0 镜像

值得精读,尤其适合 CI 工程师参考 matrix 参数化模式:如何用 fromJson 控制矩阵规模、如何通过 workflow_call 默认值避免调用方意外扩量,以及如何通过显式传参把版本决策上移。

基础设施 重要性 3.97 洞察度 3.00

AMD PR 门禁默认镜像切换到 ROCm 7.2.4

该 PR 是 CI 基础设施调整,值得快速了解,但无深度技术内容。关注点在于默认镜像切换的合理性,以及调用方显式化是否足够清晰。建议阅读 PR 中关于调用方显式化的 commit message,体会 CI 配置可追溯性的设计。

功能 重要性 9.18 洞察度 6.00

MiniMax-H3 新增 GGUF 量化 transformer 加载路径

值得精读。核心设计决策包括:以头部元数据先行 + mmap-backed 加载避免全量克隆;按张量级元数据做 per-layer 量化方法分派并复用 SRT 反量化内核;用实测数据否决 fused MMVQ/MMQ 而选择反量化 + 原生 GEMM;以及把配置冲突全部前置到下载前 fail-fast。特别建议关注 FP32 精度岛与 BF16 性能权衡的取舍逻辑,以及 `_reject_lora_on_packed_weights` 把校验放在 offload 物化之前的防御式设计。

性能优化 重要性 6.99 洞察度 6.00

TRTLLM 解码按 KV 长度拆分,混合上下文迭代降 10%

值得精读。重点看 `_run_fixed_q_len_decode` 的排序-分组-拼回模式,理解其如何在 CUDA graph 捕获下保持输出顺序;同时关注 Fridge003 提出的默认值问题,后续可结合生产数据评估是否将默认 splits 提升到 2 甚至 4。风险控制上,建议补充 splits=3/4 及大 batch 的回归测试。

缺陷修复 重要性 8.27 洞察度 7.00

大 vocab 表驻留 host,layerwise offload 显存降 48%

值得精读。重点看三点:为何由 shape 自动发现改为显式 opt-in(forward hook 覆盖边界是核心教训);detach/restore 如何包住 `.to(device)` 迁移窗口;以及 7 个测试如何 pin 契约(declared/undeclared/sharded/round trip/等价性)。对做显存卸载或 CPU 驻留优化的同学是很好的模板。

#35450 Update deepep for SBO feature

原始 PR · 作者 Fridge003 · 合并时间 2026-08-20 14:37

基础设施 重要性 3.85 洞察度 3.00

升级 sgl-deep-ep 至 0.1.2 并启用 SBO 测试

该 PR 是常规依赖升级和测试启用,简单明确,无需精读。可关注 sgl-deep-ep 后续版本是否引入新的 API 变化。

缺陷修复 重要性 6.16 洞察度 6.00

修复 SM120 GPU 误用 TMA 快速路径问题

该 PR 值得精读,尤其是理解硬件能力门控设计。其亮点在于将复杂的内核选择逻辑拆分为可测试的纯函数,并针对新硬件架构(SM120)给出明确回退策略。可关注跨 PR 演进中 `_use_fast` 的进一步优化。

参与讨论