升级 flashinfer 依赖至 0.6.14
该 PR 是必要的依赖升级,值得仔细 review 和测试。建议合并后密切关注 CI 中各测试项(尤其是 attention 和 MoE)的执行结果。MoE 测试的修改值得学习,展示了如何适配上游库的 breaking change。同时,建议跟踪 flashinfer-cubin 发布状态,及时恢复 pyproject.toml 依赖。
SGLang is a high-performance serving framework for large language models and multimodal models.
升级 flashinfer 依赖至 0.6.14
该 PR 是必要的依赖升级,值得仔细 review 和测试。建议合并后密切关注 CI 中各测试项(尤其是 attention 和 MoE)的执行结果。MoE 测试的修改值得学习,展示了如何适配上游库的 breaking change。同时,建议跟踪 flashinfer-cubin 发布状态,及时恢复 pyproject.toml 依赖。
原始 PR · 作者 iforgetmyname · 合并时间 2026-07-10 08:49
NPU 使用独立 EP 通信组
值得合并。PR 聚焦、改动小、解决真实崩溃问题,且得到 reviewers 确认。建议后续补充 NPU 相关的单元测试。
修复 DFlash 启动时 attn_backend 未就绪导致的崩溃
简单且关键的启动修复,建议快速合并。可作为初始化顺序依赖的典型案例供开发者参考。
原始 PR · 作者 merrymercy · 合并时间 2026-07-10 08:31
支持自定义 TokenizerWorker 扩展点
值得关注的设计模式:通过 `ServerArgs` 提供方法作为扩展点,结合校验函数保证类型安全。适合作为管道架构中增加可插拔组件的范例,建议在类似场景中参考。
原始 PR · 作者 merrymercy · 合并时间 2026-07-10 08:03
在 CI 权限配置中添加新成员
该 PR 属于常规的权限管理变更,无需精读。
交换 dual-stream MoE 执行顺序,消除 CUDA graph 流爆炸
值得精读,特别是 GPU 编程中 CUDA graph 捕获与 tensor 生命周期管理的设计模式。展示了别名和 capture flag 两种解决方案的权衡,以及如何通过细粒度标志避免跨流的内存释放问题。
让 DeepSeek-V4 attention 后端能容忍 CPU seq_lens mirror 缺失
该 PR 属于小型重构,值得快速合并。建议阅读者重点关注 `needs_cpu_seq_lens` 的推导逻辑和 `seq_lens_cpu` 缺省时的回退路径,尤其是 `draft_extend_seq_lens_cpu` 的 fallback(使用设备端 `seq_lens` 替代 CPU 镜像)。
第二波冗余单元测试清理,删除 770 行无价值测试
建议阅读改进后的规则文档,特别是'区分性测试'部分,以理解如何平衡测试冗余与覆盖完整性。本 PR 的方法论(使用验证代理交叉检查)值得在类似清理任务中复用。
参与讨论