Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51

PR 列表

更多筛选
2026-08-11
缺陷修复 重要性 3.43 洞察度 2.00

钉死 cuda-tile 1.6.0rc5,修复 Python 3.10 x86_64 安装失败

值得快速浏览,作为'传递依赖导致安装链路破裂'的典型案例。核心设计决策是:用 `==` 精确 pin 临时止血,并在代码注释中记录原因和解除条件,避免后续维护者无从下手。建议关注合并后 CI 是否全绿,并跟踪 `cuda-tile 1.6.0rc6` 是否补发 wheel,以便及时解除 pin。

性能优化 重要性 5.77 洞察度 7.00

ROCm HiSparse DSv4 swap-in 融合为单次拷贝,decode 路径提速最高约 21%

值得精读。该 PR 是典型的 ROCm 波前级性能优化案例,包含反汇编驱动的根因分析、编译期常量展开技巧、以及一个反直觉的结论(更少 pass 的 128 位拷贝反而更慢),对理解 wave64 占用率与宿主内存延迟的权衡有较高参考价值。建议关注 `transfer_dsv4_item_warp` 的实现细节(空 lane 处理、双层 unroll 的负载/存储分区)以及新测试对“未写槽位保持填充”的断言设计。若团队在 AMD 平台使用 HiSparse DSv4,此 PR 应合入且可考虑在后续 CI 中补充 ROCm 内核反汇编级别的回归检查。

缺陷修复 重要性 4.42 洞察度 7.00

2-CTA TGV GEMM 补尾部集群屏障,修复 Xid 13 崩溃

值得精读。虽然代码仅 15 行,但包含三层价值:一是集群 kernel 需要入口同步与退出同步配对的一般性教训;二是 review 中关于 relaxed 内存序与 per-warp 提前 arrive 权衡的深入讨论;三是用 CUDA core dump 根因分析 + 生产 A/B 验证竞态类缺陷的完整方法论。维护 Kimi-K3/DSPARK 或 Blackwell PDL CUDA graph 路径的团队建议尽快合入,并考虑 cherry-pick 到 kimi-k3 overlay 镜像线。

性能优化 重要性 5.79 洞察度 7.00

HiSparse ROCm miss 拷贝改 128 位非临时加载,decode 提速

值得精读,重点看三处:(1) 门控条件的推导——为什么 128 位拷贝在 512B item 下反而更慢,`item_size_bytes >= WARP_SIZE * 16` 背后的 lane 利用率模型;(2) `__builtin_nontemporal_load` 与缓存 store 的取舍——源只读一次用 non-temporal,目标被后续 attention 内核读所以保留缓存;(3) 接缝测试的参数设计——覆盖宽路径与 64 位/字节余量循环的每个衔接形状,并用 `skipif(not is_hip())` 明确 CUDA 分支的契约边界。建议把 PR body 的 benchmark 表格与 commit 2 的隔离实验一起看,这是一个完整的“优化→发现回归→定位根因→门控→补测试”闭环。

#31847 [spec decoding] support inkling dspark

原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-08-11 04:21

功能 重要性 8.81 洞察度 6.00

为 Inkling 打通 DSPARK 投机解码并新增融合 Triton 内核

值得精读,尤其是三个设计决策:(1) fast path + 严格 eligibility 检查并静默回退的模式(dspark.py 的 `_build_fused_kv_write_bundle`);(2) 在 kernel 内用 `HAS_COMMIT_LENS` 处理截断写入,替代 host 端 mask 尾部列的做法;(3) muP folded head 的除法位置选择——在 base logits 处除一次而不是在加载权重时改写权重。建议阅读顺序:dspark.py 的 bundle 构建 → fused_kv_write.py 的 kernel → mamba_state_scatter_triton.py 的 meta 表设计。

#33820 Add Intern-S2-Mobius cookbook

原始 PR · 作者 JustinTong0323 · 合并时间 2026-08-11 04:13

文档 重要性 7.16 洞察度 4.00

新增 Intern-S2-Mobius 配置驱动 cookbook 部署指南

建议文档、DX 与模型部署方向的读者精读;值得关注的决策包括 cookbook 数据建模(反规范化 cells + verified 标记)、“示例输出必须 verbatim”的文档质量约定,以及 MTP/NEXTN 与高并发吞吐的实测对比对用户配方的直接指导意义。对普通内核/SRT 工程师价值有限,可略读。

#33146 Support thinking budget for Inkling

原始 PR · 作者 draftbk · 合并时间 2026-08-11 02:01

缺陷修复 重要性 7.15 洞察度 5.00

修复 thinking budget 静默失效,新增 Inkling 支持

值得精读。该 PR 展示了一条关于特殊 token 语义与拼接序列状态判定的典型教训:用 `in` 判定块开关状态在 token 复用场景下会静默失效,`_open_thinking_start` 的反向扫描是简洁的修复方案。值得关注的设计决策包括:将状态判定收敛为独立辅助函数、对单 delimiter 序列保持行为不变的兼容性承诺、以及用测试将子类 token ID 与 tokenizer 常量绑定。

性能优化 重要性 5.07 洞察度 4.00

DCP LSE 合并改为原地复用 partial 输出,消除 OOM

改动很小但触及 DCP 核心合并路径,值得快速阅读 `cp_lse_ag_out_rs_mha` 的原地复用写法;关注重点是调用方张量生命周期约定和 LSE 基数遗留问题。后续若有统一 MHA/MLA LSE 合并测试或 base 处理,应跟踪。

参与讨论