Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58

PR 列表

更多筛选
2026-08-20

#35419 [Docs] Update contribution guide

原始 PR · 作者 mmangkad · 合并时间 2026-08-20 13:31

文档 重要性 4.28 洞察度 3.00

更新贡献与评估指南,对齐最新 CI 与测试流程

值得作为文档维护的样板浏览,重点看'测试注册与本地运行'和'Mintlify 链接检查'两节,它们准确反映了 SGLang CI 的真实行为;若你在维护内核或自定义库(DeepGEMM/DeepEP),新增的工作流章节有直接参考价值。无需精读代码逻辑。

缺陷修复 重要性 6.34 洞察度 6.00

允许 W4AFP8 requant 内核处理仅 128 对齐的隐藏维度

值得精读。三个设计点尤其值得学习:一是用 `HAS_K_TAIL: tl.constexpr` 做编译期特化,让完整块路径零开销、尾部路径单独获得掩码;二是测试通过整数输入 + 2 的幂 scale 实现 e4m3 位精确断言,并用哨兵值验证 padding 行不被触碰,测试设计严谨且可复现;三是性能对比方法论(CUDA graph 内计时排除 Python 启动开销、A/B 顺序交错避免首次测量偏差、opcode 与访存宽度对比证明无向量化损失),可直接迁移到其他 Triton 内核变更的评审中。

功能 重要性 7.95 洞察度 5.00

加载日志按内存类型报告组件权重驻留位置

值得精读。虽然只是日志增强,但 `component_residency_bytes()` 的实现有几个可复用的设计:用 `/proc/self/maps` 区分 file-backed 与 anonymous host 内存、用 storage 指针去重避免扁平 buffer 重复计数、pinned 判断先于 file-backed 判断(因为 CUDA host allocator 背后是命名映射)。对任何需要诊断显存/内存占用的模块都有参考价值。

#34546 [XPU] Fix/kimi linear xpu

原始 PR · 作者 SKRohit · 合并时间 2026-08-20 12:43

缺陷修复 重要性 5.88 洞察度 4.00

修复 KimiLinear 模型 XPU 崩溃,回退无 JIT kernel 路径

值得精读的部分是平台 gating 的设计模式:用 `is_xpu()` 把不支持的 kernel 路径整体挡掉并复用既有 fallback(与 CPU/NPU 一致),以及 review 中『修改模型权重契约 vs 在 kernel 调用点适配』的决策——后者是更稳妥的做法。不建议作为架构参考,属于一次性适配;如后续保留该支持,建议补一个 XPU 单元测试或注释文档。

缺陷修复 重要性 6.28 洞察度 5.00

修复 Hopper 上 Cosmos3 T=1 融合回归。

值得精读,因为涉及架构相关性能路径的准入控制,展示了如何在多平台环境下进行特性开关的修复。关注点:平台判断的封装方式、未来是否会对更多架构进行类似控制。

基础设施 重要性 3.14 洞察度 3.00

FLUX 对比 CI 改用 canonical residency 选择器

值得快速浏览,作为 diffusion nightly CI 配置维护的参考。可关注 canonical `--component-residency` 参数在 CI 中的实际验证情况,以确认其与 legacy 参数等价。

重构 重要性 5.38 洞察度 3.00

降低 diffusion 每请求日志噪音,关键消息降级为 debug

此 PR 简单明确,值得快速 review,可作为日志管理的良好实践参考。

参与讨论