Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51

PR 列表

更多筛选
2026-07-10

#29910 [Dep] Upgrade flashinfer to 0.6.14

原始 PR · 作者 Fridge003 · 合并时间 2026-07-10 08:52

基础设施 重要性 5.80 洞察度 4.00

升级 flashinfer 依赖至 0.6.14

该 PR 是必要的依赖升级,值得仔细 review 和测试。建议合并后密切关注 CI 中各测试项(尤其是 attention 和 MoE)的执行结果。MoE 测试的修改值得学习,展示了如何适配上游库的 breaking change。同时,建议跟踪 flashinfer-cubin 发布状态,及时恢复 pyproject.toml 依赖。

#29030 [NPU] use standalone group for moe ep

原始 PR · 作者 iforgetmyname · 合并时间 2026-07-10 08:49

功能 重要性 6.36 洞察度 5.00

NPU 使用独立 EP 通信组

值得合并。PR 聚焦、改动小、解决真实崩溃问题,且得到 reviewers 确认。建议后续补充 NPU 相关的单元测试。

#30680 Fix DFlash mamba verify init ordering

原始 PR · 作者 mmangkad · 合并时间 2026-07-10 08:40

缺陷修复 重要性 5.84 洞察度 4.00

修复 DFlash 启动时 attn_backend 未就绪导致的崩溃

简单且关键的启动修复,建议快速合并。可作为初始化顺序依赖的典型案例供开发者参考。

缺陷修复 重要性 6.69 洞察度 6.00

交换 dual-stream MoE 执行顺序,消除 CUDA graph 流爆炸

值得精读,特别是 GPU 编程中 CUDA graph 捕获与 tensor 生命周期管理的设计模式。展示了别名和 capture flag 两种解决方案的权衡,以及如何通过细粒度标志避免跨流的内存释放问题。

重构 重要性 6.07 洞察度 4.00

让 DeepSeek-V4 attention 后端能容忍 CPU seq_lens mirror 缺失

该 PR 属于小型重构,值得快速合并。建议阅读者重点关注 `needs_cpu_seq_lens` 的推导逻辑和 `seq_lens_cpu` 缺省时的回退路径,尤其是 `draft_extend_seq_lens_cpu` 的 fallback(使用设备端 `seq_lens` 替代 CPU 镜像)。

测试 重要性 7.20 洞察度 5.00

第二波冗余单元测试清理,删除 770 行无价值测试

建议阅读改进后的规则文档,特别是'区分性测试'部分,以理解如何平衡测试冗余与覆盖完整性。本 PR 的方法论(使用验证代理交叉检查)值得在类似清理任务中复用。

参与讨论