融合 LTX2 QKNorm+split-RoPE CUDA 内核,B200 端到端加速 ~9%
值得精读。重点关注:① `@register_custom_op` 与 `fake_impl` 结合 `torch.compile` 的技法;② 条件降级与全局禁用模式的设计;③ CUDA kernel 内 warp 级 rstd reduce 的写法。
SGLang is a high-performance serving framework for large language models and multimodal models.
融合 LTX2 QKNorm+split-RoPE CUDA 内核,B200 端到端加速 ~9%
值得精读。重点关注:① `@register_custom_op` 与 `fake_impl` 结合 `torch.compile` 的技法;② 条件降级与全局禁用模式的设计;③ CUDA kernel 内 warp 级 rstd reduce 的写法。
原始 PR · 作者 changminbark · 合并时间 2026-07-01 13:55
修复 MLX 后端 write_token 越界写入 bug
值得精读,这是一个典型的边界修复,代码改动简洁且与现有数据结构的设计一致,测试覆盖完整。可作为 MLX 后端类似改动的参考。
修复 MLX 后端 prefill_aware_swa 属性缺失崩溃
建议合并。这是一个关键但简单的 bugfix,修复了 MLX 后端的启动崩溃。值得注意的设计是采用类属性默认值来弥补轻量初始化跳过的状态设置,与已有的 `canary_manager` 处理一致。
原始 PR · 作者 LijuanTang94 · 合并时间 2026-07-01 13:55
修复 MLX 后端步长限制分析无法自动停止的问题
值得精读。该 PR 展示了在非标准调度路径中准确插桩 profiling 钩子的模式,以及如何通过幂等设计提高 CLI 工具的健壮性。对于维护 MLX 后端或类似定制调度逻辑的开发者有直接参考价值。
原始 PR · 作者 qinsir5522 · 合并时间 2026-07-01 11:15
更新 NPU 文档中 LoRA 和 MoE 参数描述
该 PR 为简单的文档修正,无需深入审查。建议快速合并。
修复 EPD 全局缓存 TP 下编码器健康检查挂起问题
该 PR 是一个典型的小范围 bugfix,逻辑清晰,改动集中。值得关注的是其修复思路——通过识别请求类型并路由到不同的处理路径,解决了分布式环境下控制流不一致导致的死锁问题。适合作为理解 EPD 架构中健康检查与请求分发机制的参考。
原始 PR · 作者 zhangxiaolei123456 · 合并时间 2026-07-01 10:11
优化 C128 状态池分配,解耦 SWA 映射修复精度
该 PR 值得精读,因为它展示了如何解决 KV 缓存管理中的生命周期不匹配问题,以及如何从显式 SWA 映射过渡到请求级状态分配。对于理解 DeepSeek-V4 的压缩状态管理和 PD 分离架构很有价值。重点关注 `pool_configurator.py` 中内存计算调整、`deepseek_v4_memory_pool.py` 中状态布局重构以及新的 JIT kernel 清理机制。
修复 Offloader 在 CUDA graph 捕获时的流隔离错误
值得精读,尤其是理解 CUDA graph stream capture isolation 约束和异步 prefetch 的交互。设计上采用了条件分支来动态适配捕获状态,思路清晰。后续可考虑更优雅的方案(如预分配 pinned memory 或利用 cudaMemcpyAsync 的流顺序语义)来恢复部分 overlap 收益。建议在 merge 后跟踪 torch.compile 兼容性 issue。
参与讨论