为 AMD DeepSeek-V4 添加 unified KV attention 后端
该 PR 展示了如何在现有复杂代码库中通过 gate 引入重大新功能,值得关注其设计权衡(统一池 vs 独立池、CG safety)。对于 AMD 推理栈开发者,建议仔细 review 内核健壮性并补充 AMD 硬件上的测试。
SGLang is a high-performance serving framework for large language models and multimodal models.
为 AMD DeepSeek-V4 添加 unified KV attention 后端
该 PR 展示了如何在现有复杂代码库中通过 gate 引入重大新功能,值得关注其设计权衡(统一池 vs 独立池、CG safety)。对于 AMD 推理栈开发者,建议仔细 review 内核健壮性并补充 AMD 硬件上的测试。
合并 SWA 写位置参数为 KVWriteLoc 对象
建议精读 `memory_pool.py` 中的 `KVWriteLoc` 和 `unwrap_write_loc` 设计,以及 `set_kv_buffer` 签名的统一化改造。这是多后端统一接口重构的典型案例。
统一所有 Attention 后端的 SWA 写位置缓存,避免每层重复翻译
值得精读。展示了如何在多后端架构中统一 KV 缓存写路径的性能优化,特别是 CUDA-graph 下预分配 buffer + copy_ 的技巧。设计决策中的 assert 防守和 clear 尾部数据是生产级代码的良好习惯。
修复 FLUX.2 compile 模式的布尔运算兼容性 bug
值得合并:小改动无风险,但修复了重要模型的 compile 兼容问题,建议参与审核的工程师确认语义等价后合并。
AMD Docker 镜像中 MoRI 库更新至 v1.2.0
该 PR 为简单的依赖版本更新,无需详尽审查。建议快速合入以确保 AMD 用户能正常使用最新网络功能。
提取EAGLE v2的KV缓存移动函数至spec_utils
此PR展示了安全的提取共享工具模式,值得参考。若计划新增其他spec worker(如MTP、Medusa),可直接复用此函数。
重构CUDA Graph Runner/Backend分层架构
值得深度精读。重点关注`BaseCudaGraphBackend`接口设计(如何平衡通用性与灵活性)、`CudaGraphConfig`配置数据类(Phase/Backend枚举设计、diff-based导出)以及`BaseCudaGraphRunner`与后端之间的`capture_session`/`replay_session`上下文管理。这些设计模式可直接应用于其他硬件后端或自定义捕获策略。
重构 diffusion 实时控制状态与适配器,统一信号队列
值得精读,尤其是 control_signals.py 中脚本/状态两种控制模式的抽象设计和 states/ 子包的组织方式。它为后续新增实时模型(如更多 diffusion 模型)提供了清晰的基础设施。建议在合并后运行完整的 diffusion 测试套件并观察 CI 结果。
参与讨论