Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 00:08 同步状态:空闲 下次计划:2026-09-03 01:08
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-06-30
缺陷修复 重要性 6.54 洞察度 4.00

修复 SWA 池因未预算 draft KV 导致 OOM

这是一次必要且安全的 bugfix,逻辑清晰。特别推荐给关注 SWA 与 speculative decode 内存管理的工程师精读,尤其是 `pool_configurator.py` 中 `_cell_size` 的计算方式。

缺陷修复 重要性 5.15 洞察度 3.00

NPU 上 Qwen3-VL extend 阶段路由到 fused 算子

建议审核者关注 review 评论中提到的 mrope_positions 问题,确认 forward_prepare_npu 是否已适配 Qwen3-VL 的 3D 位置编码需求。建议补充精度测试,确保精度不退化。

#29393 [Deps] Bump transformers to 5.12.1

原始 PR · 作者 mmangkad · 合并时间 2026-06-30 15:54

重构 重要性 8.93 洞察度 5.00

升级 transformers 至 5.12.1 并清理兼容层

建议精读 `mistral_utils.py` 中的 adapter 模式,它展示了如何通过 monkey-patch 平滑适配上游 API 变化而不影响核心代码。同时 `config.py` 和 `tokenizer.py` 的清理贯彻了“移除过时 workaround”的好实践。对于计划升级依赖的开发者,本 PR 提供了完整的兼容性管理案例。

性能优化 重要性 6.38 洞察度 5.00

AMD 平台跳过 D2H copy_stream 同步,decode 提升 12-17%

建议精读。本 PR 展示了一个值得学习的权衡案例:通用优化(copy_stream 重叠)在特定硬件上可能因同步开销导致反效果。对于类似情况,建议引入平台感知的调度条件分支。此外,该 PR 的验证手段(GSM8k + 性能 benchmark)可作为小范围性能修复的参考模板。

#29613 [DSA] Use cos_sin_cache for DSA indexer fusion

原始 PR · 作者 mmangkad · 合并时间 2026-06-30 14:49

缺陷修复 重要性 7.25 洞察度 5.00

DSA indexer 融合直接使用 cos_sin_cache 避免缓存不同步

建议相关开发者阅读此 PR,了解如何通过简化缓存设计消除冗余和潜在 bug。对于使用 DSA indexer 的模型(如 GLM-5.2)部署可提升内存效率。

#29710 [HiSparse]: Skip flaky hisparse-nixl ci

原始 PR · 作者 hzh0425 · 合并时间 2026-06-30 14:04

缺陷修复 重要性 3.53 洞察度 2.00

跳过不稳定的 NIXL HiSparse 测试

可合并。作为临时缓解措施,长期应分析测试失败根因并修复。

测试 重要性 7.49 洞察度 3.00

清理DeepSeek V3.2测试并升级GLM测试至5.2

本PR属于测试清理维护,技术含量较低,但体现了团队及时清理过时测试资源的良好实践。若关注GLM或DeepSeek测试架构,可了解测试注册模式(register_cuda_ci)。

参与讨论