更新 ROCm Docker AITER 版本并适配新 API
此 PR 为常规基础设施更新,建议阅读 `docker/rocm.Dockerfile` 中的版本变更,了解 AMD GPU 构建的最新依赖。`aiter_backend.py` 的 1 行改动值得留意:当第三方库 API 变更时,如何以最小改动兼容新签名。
SGLang is a high-performance serving framework for large language models and multimodal models.
更新 ROCm Docker AITER 版本并适配新 API
此 PR 为常规基础设施更新,建议阅读 `docker/rocm.Dockerfile` 中的版本变更,了解 AMD GPU 构建的最新依赖。`aiter_backend.py` 的 1 行改动值得留意:当第三方库 API 变更时,如何以最小改动兼容新签名。
原始 PR · 作者 huangtingwei9988 · 合并时间 2026-07-01 15:44
将 HiCache L3 哈希生成从 Python per-token 循环改为 C++ native 扩展,实现约 70× 加速
值得精读。该 PR 展示了一种典型的热点路径优化模式:识别 Python 循环瓶颈,通过 C++ 扩展和 AVX2 指令集大幅加速,同时保持 Python 调用的便利性。设计决策中关于 per-page scratch buffer 的使用、bigram 重叠对的生成、以及优先利用已有 `array` 缓冲区避免额外拷贝的思想,值得在其他性能敏感模块中借鉴。
加强 JIT 和 sgl-kernel 测试的形状覆盖
值得阅读的 PR。它展示了如何为 kernel 测试建立高效的生产环境覆盖策略——通过 `get_ci_test_range` 分离 CI 和本地/nightly 测试范围。与 RFC #29630 的关系进一步说明了测试基础设施对架构演进的重要性。建议所有 kernel 贡献者学习此模式,在新增 kernel 时同步添加 production-like shape 测试。
清理 diffusion 模块的未使用导入和死代码
作为常规清理 PR,不必强制精读;但 `vmoba/__init__.py` 中的显式 re-export 模式值得在其他模块推广,可提升 IDE 跳转和静态分析准确性。
原始 PR · 作者 yctseng0211 · 合并时间 2026-07-01 15:39
拆分 AMD 夜测任务避免超时
值得合并,解决了夜测稳定性痛点,不影响任何生产代码,且已在两个 ROCm 版本上验证通过。对于 CI 维护者,可参考此模式拆分其他超时 job。
修复 DSA fp8 trtllm CP 下 KV gather 形状不匹配崩溃
本 PR 修复了关键的 shape mismatch 崩溃,设计思路清晰(延迟 gather 直到形状正确)。建议精读 `_should_defer_dsa_cp_kv_gather` 的条件判断和 `_all_gather_dsa_trtllm_fp8_kv` 中拼接-通信-切分的实现。合并后应关注非连续张量的潜在问题。
修复 NPU GLM-4.6V 处理器参数名变更
建议合并。确认上游 transformers 版本兼容性。
为 HTTP 入口添加 zstd 解压缩与头部覆盖
此 PR 设计清晰,采用环境变量门控、ASGI 中间件模式,值得参考。建议阅读实现中的错误处理和类型转换细节,特别是 `wrapped_receive` 模拟 ASGI 完整体的技巧。
参与讨论