Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-06-19
文档 重要性 4.53 洞察度 2.00

文档修复:补充 Laguna 模型远程代码信任参数

该 PR 为纯粹的文档修复,无需精读源码。值得注意的设计决策是:在 `laguna-m1.jsx` 中通过在每个 cell 的 `flags` 数组中加入参数,而非在全局配置中统一添加,保持了模块化但增加了维护成本。对于类似需要全局参数的场景,可考虑在 JSX 配置层抽象一个 'global flags' 机制来避免逐 cell 重复。

#28231 Use Marlin for SM120 MXFP4 MoE

原始 PR · 作者 mmangkad · 合并时间 2026-06-19 10:19

功能 重要性 9.09 洞察度 6.00

SM120 MXFP4 MoE 默认使用 Marlin 内核,删除 Triton 回退路径

值得精读。该 PR 展示了如何将 MXFP4 MoE 从手动编写 Triton 内核迁移到通用的 Marlin 后端,涉及数据格式转换、瓦片对齐和融合激活函数。关键设计决策包括:通过 `allow_tile_padding` 放松 Marlin 的形状要求,以及删除 SM120 专用的 warp 补丁。对 GPU kernel 优化和量化部署有借鉴意义。

性能优化 重要性 9.18 洞察度 6.00

AMD 推测验证分块 KV 注意力,加速~11x

该 PR 值得精读,尤其关注:如何将成熟的 flash-decode 技术跨场景迁移、多层平台门控模式的运用、以及缓存 key 设计对显存稳定性的影响。对 TritonAttnBackend 中条件调度逻辑的封装方式值得后续类似扩展复用。

#28551 Add opt-in CUDA-graph capture-trace export

原始 PR · 作者 luccafong · 合并时间 2026-06-19 09:51

功能 重要性 6.56 洞察度 6.00

新增 CUDA-Graph 捕获跟踪导出功能

简单实用的调试增强,值得快速合入。设计上保持了最小侵入性(默认关闭),值得学习。

功能 重要性 8.84 洞察度 5.50

支持混合池 staged H2D 写回 JIT 内核

建议阅读本 PR 以了解 HiCache 如何从单池 staged 扩展到混合池。关键设计点包括: 1. 将 staged module 与主 module 分离,降低编译依赖; 2. 通过 `can_use_write_back_jit` 标志解耦写回路径选择; 3. CPU 模拟测试框架(mock JIT 函数)值得复用。 对于 Mamba 精度回归,建议后续 PR 跟进确定性能差异根因或在 Mamba 池中回退到非 staged 路径。

性能优化 重要性 5.57 洞察度 3.00

移除MoE FP8量化中的冗余类型转换和拷贝

建议合并。这是一个小而明确的性能优化,经过精度验证(GSM8K)和 CI 测试,无风险。两个优化点(移除降级拷贝和 .contiguous())在 FP8/FP4 MoE 前向路径上直接减少了开销。对于理解 `per_token_group_quant_fp8` 接口和 MoE 推理优化有参考价值。

参与讨论