Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 01:22 同步状态:空闲 下次计划:2026-09-03 02:22

PR 列表

更多筛选
2026-06-30

#29768 [AMD] Stop rocm720 pr auto-runs

原始 PR · 作者 yctseng0211 · 合并时间 2026-06-30 23:58

基础设施 重要性 4.13 洞察度 2.00

停止 ROCm 7.2 PR 自动触发 CI

内容明确、改动单一,可直接合入。对关注 AMD CI 流程的人员有参考价值。

#29765 [AMD] Update AMD local registry address

原始 PR · 作者 yctseng0211 · 合并时间 2026-06-30 23:40

基础设施 重要性 4.29 洞察度 2.00

更新 AMD 本地 registry 地址并移除旧镜像作业

PR 变更简单直接,适合快速合并。建议合并后监控一次 AMD CI 运行确认新 registry 正常工作。

#25835 [JIT Kernel] Triton moe fused gate

原始 PR · 作者 DarkSharpness · 合并时间 2026-06-30 23:26

功能 重要性 8.65 洞察度 6.00

新增 Triton MoE 融合门控内核,替换 CUDA JIT

值得精读的 PR,尤其是 Triton 内核的迭代 top-k 选择策略和 PDL 用法。在采用前应关注数值回归问题,并确认模型准确性。设计上融合了正确性、性能和可维护性,但模型级测试的缺失是当前主要薄弱环节。

功能 重要性 6.95 洞察度 6.00

支持 Krea-2 Cache-DiT 加速并动态检测 CFG 模式

推荐阅读此 PR,它展示了如何将一个新模型家族(Krea-2)优雅地接入缓存系统,并通过运行时参数解决模型变体间的 CFG 差异问题。设计决策(动态探测 vs 静态注册)值得借鉴,尤其是解决蒸馏模型缓存无效的通用思路。

性能优化 重要性 6.31 洞察度 5.00

NPU GLM-4.7 MLA 与 MoE 融合算子和配置优化

**不推荐当前状态合并**。需先修复 reviewer 指出的两个 `NameError` 问题,并补充测试覆盖 Context Parallel 和 `q_lora_rank` 为 None 的场景。PR 的融合算子思路正确,但实现安全性和完整度需加强。

#28053 Disable dsr1 prefill cudagraphs by default

原始 PR · 作者 nvjullin · 合并时间 2026-06-30 16:34

性能优化 重要性 6.99 洞察度 6.00

默认禁用 DSR1 prefill CUDA graph 以修复 13% 性能回退

可快速合并,该 PR 直接解决已验证的性能回归,代码简洁且测试充分(CI 已通过)。建议后续考虑 reviewer 建议,进行通用化改造,但非当前阻塞项。

功能 重要性 9.00 洞察度 6.00

实现对 Quark W4A8 MXFP4-FP8 量化方案的 AMD 支持

此 PR 值得精读,特别是设计师处理不同量化检查点布局时的思路。关键决策包括:将 per-expert 加载器分离到独立文件、使用环境变量控制内核布局、在自动检测中添加新方案而不破坏现有逻辑。偏好精度测试应尽快补充非 nightly 的冒烟测试以提高 CI 覆盖。

#28980 [NPU] Support DeepSeek V4 Flash MTP on Ascend

原始 PR · 作者 qybnb · 合并时间 2026-06-30 16:22

功能 重要性 9.18 洞察度 6.00

NPU 上支持 DeepSeek V4 Flash MTP 推理

建议对所有文件进行仔细审查,尤其是 `ascend_dsv4_backend.py` 的 multi-step draft backend 实现和 `dsv4_allocator.py` 的状态备份机制。这些设计可复用于其他平台的多步推测解码场景。PR 虽大但模块化较好,值得精读以理解 NPU 上 DSV4 speculative decoding 的全链路。

参与讨论