Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-06-10
功能 重要性 9.00 洞察度 6.00

为 AMD DeepSeek-V4 添加 unified KV attention 后端

该 PR 展示了如何在现有复杂代码库中通过 gate 引入重大新功能,值得关注其设计权衡(统一池 vs 独立池、CG safety)。对于 AMD 推理栈开发者,建议仔细 review 内核健壮性并补充 AMD 硬件上的测试。

重构 重要性 7.59 洞察度 6.00

合并 SWA 写位置参数为 KVWriteLoc 对象

建议精读 `memory_pool.py` 中的 `KVWriteLoc` 和 `unwrap_write_loc` 设计,以及 `set_kv_buffer` 签名的统一化改造。这是多后端统一接口重构的典型案例。

性能优化 重要性 7.92 洞察度 6.00

统一所有 Attention 后端的 SWA 写位置缓存,避免每层重复翻译

值得精读。展示了如何在多后端架构中统一 KV 缓存写路径的性能优化,特别是 CUDA-graph 下预分配 buffer + copy_ 的技巧。设计决策中的 assert 防守和 clear 尾部数据是生产级代码的良好习惯。

#27669 [AMD] Update MoRI to v1.2.0

原始 PR · 作者 bingxche · 合并时间 2026-06-10 13:41

基础设施 重要性 3.12 洞察度 2.00

AMD Docker 镜像中 MoRI 库更新至 v1.2.0

该 PR 为简单的依赖版本更新,无需详尽审查。建议快速合入以确保 AMD 用户能正常使用最新网络功能。

#23906 [Refactor] Cuda Graph Runner/Backend Refactor

原始 PR · 作者 Oasis-Git · 合并时间 2026-06-10 12:36

重构 重要性 9.36 洞察度 6.00

重构CUDA Graph Runner/Backend分层架构

值得深度精读。重点关注`BaseCudaGraphBackend`接口设计(如何平衡通用性与灵活性)、`CudaGraphConfig`配置数据类(Phase/Backend枚举设计、diff-based导出)以及`BaseCudaGraphRunner`与后端之间的`capture_session`/`replay_session`上下文管理。这些设计模式可直接应用于其他硬件后端或自定义捕获策略。

重构 重要性 9.18 洞察度 6.00

重构 diffusion 实时控制状态与适配器,统一信号队列

值得精读,尤其是 control_signals.py 中脚本/状态两种控制模式的抽象设计和 states/ 子包的组织方式。它为后续新增实时模型(如更多 diffusion 模型)提供了清晰的基础设施。建议在合并后运行完整的 diffusion 测试套件并观察 CI 结果。

参与讨论