Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 02:24 同步状态:空闲 下次计划:2026-09-03 03:24

PR 列表

更多筛选
2026-07-01
性能优化 重要性 9.07 洞察度 6.00

将 HiCache L3 哈希生成从 Python per-token 循环改为 C++ native 扩展,实现约 70× 加速

值得精读。该 PR 展示了一种典型的热点路径优化模式:识别 Python 循环瓶颈,通过 C++ 扩展和 AVX2 指令集大幅加速,同时保持 Python 调用的便利性。设计决策中关于 per-page scratch buffer 的使用、bigram 重叠对的生成、以及优先利用已有 `array` 缓冲区避免额外拷贝的思想,值得在其他性能敏感模块中借鉴。

#29636 [Kernel] Strengthen kernel shape coverage

原始 PR · 作者 BBuf · 合并时间 2026-07-01 15:44

测试 重要性 6.71 洞察度 5.00

加强 JIT 和 sgl-kernel 测试的形状覆盖

值得阅读的 PR。它展示了如何为 kernel 测试建立高效的生产环境覆盖策略——通过 `get_ci_test_range` 分离 CI 和本地/nightly 测试范围。与 RFC #29630 的关系进一步说明了测试基础设施对架构演进的重要性。建议所有 kernel 贡献者学习此模式,在新增 kernel 时同步添加 production-like shape 测试。

#29789 chore: clean diffusion dead code

原始 PR · 作者 BBuf · 合并时间 2026-07-01 15:42

重构 重要性 6.14 洞察度 2.00

清理 diffusion 模块的未使用导入和死代码

作为常规清理 PR,不必强制精读;但 `vmoba/__init__.py` 中的显式 re-export 模式值得在其他模块推广,可提升 IDE 跳转和静态分析准确性。

缺陷修复 重要性 7.12 洞察度 7.00

修复 DSA fp8 trtllm CP 下 KV gather 形状不匹配崩溃

本 PR 修复了关键的 shape mismatch 崩溃,设计思路清晰(延迟 gather 直到形状正确)。建议精读 `_should_defer_dsa_cp_kv_gather` 的条件判断和 `_all_gather_dsa_trtllm_fp8_kv` 中拼接-通信-切分的实现。合并后应关注非连续张量的潜在问题。

#29381 [NPU] Fix glm 4.6v

原始 PR · 作者 zhaozx-cn · 合并时间 2026-07-01 15:13

缺陷修复 重要性 5.20 洞察度 2.00

修复 NPU GLM-4.6V 处理器参数名变更

建议合并。确认上游 transformers 版本兼容性。

功能 重要性 8.69 洞察度 4.00

为 HTTP 入口添加 zstd 解压缩与头部覆盖

此 PR 设计清晰,采用环境变量门控、ASGI 中间件模式,值得参考。建议阅读实现中的错误处理和类型转换细节,特别是 `wrapped_receive` 模拟 ASGI 完整体的技巧。

测试 重要性 4.01 洞察度 2.00

放宽 ModelOpt NVFP4 Diffusion 一致性测试阈值

建议合并。该 PR 属于标准的测试阈值维护,风险极低,且解决了实际的 CI 失败问题,有助于保持 CI 主干的绿色。值得关注的是其基于实际观测数据的阈值设定方法,可作为后续类似调整的参考。

参与讨论