Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-05-05
性能优化 重要性 5.81 洞察度 6.00

直连 all-to-all 替代功能集合,提升 diffusion 去噪速度约 18%

值得精读,理解 PyTorch 函数式集合与直接集合的性能差异。建议接受 reviewer 关于显式导入 `torch.distributed` 的建议以提高代码健壮性。

2026-05-04
性能优化 重要性 5.60 洞察度 5.00

默认启用 VAE 3D channels-last 提升解码性能

此 PR 值得阅读,特别是其 benchmark 方法和“默认启用 + 回退环境变量”的设计模式。开发者可参考类似思路,将经过验证的性能优化默认开启,同时保留逃生通道。

测试 重要性 6.51 洞察度 4.00

为 UnifiedRadixTree 添加 HiCache KL 准确性 CI 测试

值得精读,展示了如何安全地恢复被注释的测试、调整日志层级以及增强测试基础设施。尤其是 _flush_cache 的 timeout 参数化改进值得在测试工具中推广。

重构 重要性 7.31 洞察度 3.00

模型配置、注意力层与JIT内核的微小清理

值得快速浏览,重点关注 `on_after_cuda_graph_warmup` 钩子的使用场景以及 `_hf_arch`/`_hf_attr` 的提取模式,可为后续模型配置扩展提供参考。

功能 重要性 9.05 洞察度 7.00

升级 xgrammar 并引入内置 structural tags 支持更多模型 tool calling

建议团队精读此 PR,尤其是 `get_structure_constraint` 的重构和 `base_format_detector.py` 中 `get_structural_tag` 的集中化设计,这为未来添加更多模型的原生结构化约束奠定了良好基础。同时注意监控 Kimi 内置 tag 的 xgrammar 上游修复进度,以便及时重新启用。

#24172 Fix flashinfer workspace OOM

原始 PR · 作者 kpham-sgl · 合并时间 2026-05-04 16:26

缺陷修复 重要性 8.62 洞察度 6.00

修复 FlashInfer 工作区 OOM 导致分布式测试挂起

建议相关开发者精读分布式预检设计模式,重点关注 flashinfer_comm_fusion.py 中的内存分配计算和 all_reduce 投票逻辑。此变更为未来类似内存预检提供了可复用的模式。

#24348 Add release workflow for sgl-deep-gemm wheels

原始 PR · 作者 Fridge003 · 合并时间 2026-05-04 15:58

基础设施 重要性 7.07 洞察度 4.00

新增 sgl-deep-gemm wheel 发布工作流

**建议精读**:对于负责 CI/CD 或 wheel 发布的成员,本 PR 提供了完整的跨架构、跨 CUDA 版本的 wheel 发布范例。特别值得关注的设计决策包括: - 利用 local version tag 区分 cu129/cu130,并在上传 PyPI 时剥离,符合 PyPI 规范。 - 通过 `pip wheel unpack/repack` 修改平台 tag,而非重新编译,确保与 manylinux 兼容。 - 建立双发布渠道(PyPI + GH Release),平衡便利性和版本管理。 对于其他 Python 绑定的发布流程可参考此模式。

参与讨论