直连 all-to-all 替代功能集合,提升 diffusion 去噪速度约 18%
值得精读,理解 PyTorch 函数式集合与直接集合的性能差异。建议接受 reviewer 关于显式导入 `torch.distributed` 的建议以提高代码健壮性。
SGLang is a high-performance serving framework for large language models and multimodal models.
直连 all-to-all 替代功能集合,提升 diffusion 去噪速度约 18%
值得精读,理解 PyTorch 函数式集合与直接集合的性能差异。建议接受 reviewer 关于显式导入 `torch.distributed` 的建议以提高代码健壮性。
修复 Docker 构建中 cubin 下载失败被静默掩盖的问题
值得快速合并,尤其是对于有 aarch64 Docker 构建需求的团队。PR 本身聚焦、改动清晰,且经过验证。
默认启用 VAE 3D channels-last 提升解码性能
此 PR 值得阅读,特别是其 benchmark 方法和“默认启用 + 回退环境变量”的设计模式。开发者可参考类似思路,将经过验证的性能优化默认开启,同时保留逃生通道。
为 UnifiedRadixTree 添加 HiCache KL 准确性 CI 测试
值得精读,展示了如何安全地恢复被注释的测试、调整日志层级以及增强测试基础设施。尤其是 _flush_cache 的 timeout 参数化改进值得在测试工具中推广。
模型配置、注意力层与JIT内核的微小清理
值得快速浏览,重点关注 `on_after_cuda_graph_warmup` 钩子的使用场景以及 `_hf_arch`/`_hf_attr` 的提取模式,可为后续模型配置扩展提供参考。
原始 PR · 作者 Seven-Streams · 合并时间 2026-05-04 17:30
升级 xgrammar 并引入内置 structural tags 支持更多模型 tool calling
建议团队精读此 PR,尤其是 `get_structure_constraint` 的重构和 `base_format_detector.py` 中 `get_structural_tag` 的集中化设计,这为未来添加更多模型的原生结构化约束奠定了良好基础。同时注意监控 Kimi 内置 tag 的 xgrammar 上游修复进度,以便及时重新启用。
修复 FlashInfer 工作区 OOM 导致分布式测试挂起
建议相关开发者精读分布式预检设计模式,重点关注 flashinfer_comm_fusion.py 中的内存分配计算和 all_reduce 投票逻辑。此变更为未来类似内存预检提供了可复用的模式。
新增 sgl-deep-gemm wheel 发布工作流
**建议精读**:对于负责 CI/CD 或 wheel 发布的成员,本 PR 提供了完整的跨架构、跨 CUDA 版本的 wheel 发布范例。特别值得关注的设计决策包括: - 利用 local version tag 区分 cu129/cu130,并在上传 PyPI 时剥离,符合 PyPI 规范。 - 通过 `pip wheel unpack/repack` 修改平台 tag,而非重新编译,确保与 manylinux 兼容。 - 建立双发布渠道(PyPI + GH Release),平衡便利性和版本管理。 对于其他 Python 绑定的发布流程可参考此模式。
参与讨论