Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 22:27 同步状态:空闲 下次计划:2026-09-03 23:27

PR 列表

更多筛选
2026-07-15
缺陷修复 重要性 5.67 洞察度 3.00

移除 AMD HiCache 的 layer_first 降级分支

**建议合入**:该 PR 逻辑清晰,是 #28534 的必要清理,消除死代码和矛盾逻辑。值得关注的是其与 #28534 的协作:先让 ROCm 支持 JIT 写回,再移除封堵。建议阅读 `_resolve_layout_io_compatibility` 的整体方法,理解 HiCache 的布局- IO 兼容性规范。

缺陷修复 重要性 6.79 洞察度 6.00

修复 CUDA Graph 模式下 QuickReduce 的 flag 残留错误

值得精读。该 PR 展示了 CUDA Graph 下常见但隐蔽的 flag 固化问题,以及通过在设备端维护动态状态来绕过的设计模式。对于需要支持 CUDA Graph 的通信库实现具有参考价值。

重构 重要性 6.49 洞察度 4.00

搬迁 fla/mamba 内核至 sglang.kernels 统一目录

值得精读,特别是学习如何组织大规模重命名而不引入功能变化,以及如何在持续迭代中处理合并冲突。该 PR 展示了纯路径迁移的标准化流程——保持字节完全一致、分阶段搬迁、依赖导入重写。适合作为基础设施重构的参考样例。

#27106 Make UTs compatible for XPU

原始 PR · 作者 ANSHUMAN87 · 合并时间 2026-07-15 12:35

测试 重要性 5.27 洞察度 5.00

使 UT 兼容 XPU 设备

该 PR 虽然改动量小,但体现了良好的设备抽象设计:将 `cuda` 硬编码替换为 `get_device()` 等通用接口。对于需要跨硬件平台运行的测试和工具代码,这是一个值得采用的模式。建议读者关注 `sglang.srt.utils.get_device` 和 `get_default_distributed_backend` 的使用。

线性注意力/MiniMax稀疏/扩散内核搬迁至sglang.kernels

值得仔细阅读。该 PR 展示了大规模代码组织重构的最佳实践:使用逐字节搬迁保持历史可追溯性、统一注册入口、系统更新所有导入引用。对于关注代码架构和内核管理的工程师有参考价值。

重构 重要性 8.80 洞察度 3.00

搬迁 DSA/DSV4 注意力内核至 sglang.kernels

建议关注 DeepSeek 相关内核开发的工程师精读此 PR,了解新内核包的目录结构和导入约定。值得注意的设计决策:采用字节相同的移动确保功能零回归;从混合模块中提取纯内核代码到独立文件,提高了模块化;多次合并冲突处理展示了大范围重构中的协作模式。

#31231 Fix gate stride for 4D decode layouts

原始 PR · 作者 merrymercy · 合并时间 2026-07-15 11:06

缺陷修复 重要性 5.25 洞察度 4.00

修复 4D decode 布局下门控张量的步长错误

建议精读此 PR,理解 4D 张量步长计算的细微差别。该修复虽小,但涉及 Triton kernel 中张量步长的正确使用,对类似数据布局问题有参考价值。

#31092 Fix post-capture KV sizing for SWA pools

原始 PR · 作者 merrymercy · 合并时间 2026-07-15 11:06

缺陷修复 重要性 5.65 洞察度 4.00

修复 SWA pool 未传入 post_capture 标志导致内存分配偏小

值得快速合并。属于明确的 bug 修复,逻辑清晰,改动量小。建议阅读 `post_capture_kv_sizing_planned` 方法中以守卫条件替代复杂 return 语句的设计决策,这是提升可读性和可维护性的好做法。

参与讨论