利用 NIXL path-mode 避免 Python GIL 延迟
建议精读 `_probe_path_mode()` 的探测技巧和 `storage()` 的分支设计,这是典型的特性探测 + 优雅降级模式。如项目已确定最低 NIXL 版本 ≥ 1.3.0,可考虑未来 PR 中删除 fd 回退路径。测试增强部分也值得推广到其他后端。
SGLang is a high-performance serving framework for large language models and multimodal models.
利用 NIXL path-mode 避免 Python GIL 延迟
建议精读 `_probe_path_mode()` 的探测技巧和 `storage()` 的分支设计,这是典型的特性探测 + 优雅降级模式。如项目已确定最低 NIXL 版本 ≥ 1.3.0,可考虑未来 PR 中删除 fd 回退路径。测试增强部分也值得推广到其他后端。
为 DeepSeek NextN 添加融合 EH Norm JIT kernel,加速 10~20 倍。
值得精读,特别是 JIT kernel 的封装模式(@cache_once、load_jit)和 CUDA kernel 的融合策略。可作为后续相似融合 kernel 开发的参考。
支持BF16 Qwen3 FlashInfer MOE A2A路径
值得精读,特别是 `should_skip_post_experts_all_reduce` 的设计权衡和CUDA kernel中的空tokens保护模式。该PR展示了针对分布式MoE+Attention组合的典型调试模式(all-reduce重复、CUDA边界条件)。
更新 DSv4 文档 GPU 列表和 AMD 备注
无需特别关注。这是非常小的文档修正,适合快速合并。
原始 PR · 作者 arathi-hlab · 合并时间 2026-07-01 16:27
为 Intel XPU 添加 nightly GSM8K 准确性测试
值得关注此 PR 的设计模式:通过 Mixin 复用共享评估逻辑、Step Summary 统一输出格式。对于跨后端的测试基础设施团队有借鉴意义。同时注意 continue-on-error 在 nightly 流中的权衡,建议定期审查测试结果。
添加 DS-R1 MXFP4 TP4 MTP 的 AMD 夜测。
建议精读 `setUpClass` 中的环境变量配置,可作为 AMD MI35x 上 AITER + MXFP4 最佳实践参考。同时也应关注 Gemini 建议的防御性检查,可在后续修复中引入。
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-07-01 16:13
为 AMD 注册 ltx2_ada_values JIT 内核测试
可直接批准。此 PR 展示了如何为已有 NVIDIA 测试添加 AMD 覆盖,可作为后续类似操作的范例。
更新 ROCm Docker AITER 版本并适配新 API
此 PR 为常规基础设施更新,建议阅读 `docker/rocm.Dockerfile` 中的版本变更,了解 AMD GPU 构建的最新依赖。`aiter_backend.py` 的 1 行改动值得留意:当第三方库 API 变更时,如何以最小改动兼容新签名。
参与讨论