Prhub

sgl-project/sglang · 标签视图

标签列表

聚合结果

mla 相关 PR

2026-08-29
性能优化 重要性 9.34 洞察度 7.00

DCP1→N 传输打包成连续 RDMA 块,TTFT 最高降 39%

值得精读。核心看点:把 descriptor-bound 的传输瓶颈重新建模为带宽问题;`try_pack_dcp_src` 的 stream 同步与 fallback 设计;NIXL 异步读取与 chunk barrier 的配合方式;以及按 DCP rank 固定分区来支持并发异步提交的思路。建议重点阅读 `dcp_pack.py` 与 `nixl/conn.py::transfer_worker` 两处,理解 buffer 生命周期与同步语义后再评估是否移植到 DSPARK。

2026-08-24
缺陷修复 重要性 6.51 洞察度 5.00

修复 NPU 转置批量矩阵乘超限崩溃,迁移 K3 配置

值得精读。重点关注 forward_mla_core_npu 的回退分支设计以及 review 中如何把 K3 专属参数泛化为通用 ServerArgs 参数。建议后续补充针对大形状边界的单元测试或 NPU 回归测试。

2026-08-17
性能优化 重要性 6.51 洞察度 6.00

gfx950 上 GLM-5.2 MLA absorbed bmm 切到 fused fp8 内核,TPUT 最高 +14%

该 PR 值得精读,两个设计点有复用价值:(1) 用加载期数据变换(bf16 → `fp8_e4m3fn`)去凑齐下游 kernel 选择 gate 的隐式契约,相当于在权重加载层集中做数据流归一化;(2) 输出布局与下游融合算子联合设计,用 free view 取代 per-layer 拷贝。建议读者同时参考 amd-bot 在 Issue 中的 CI 覆盖分析,把它作为“硬件门控改动必须人工补测”的案例;1am9trash 的 NextN / MTP 扩展建议是自然的后续工作。

2026-08-16
功能 重要性 6.43 洞察度 5.00

gfx950 启用密集 MHA 预填充回退,TTFT 降 22%-43%

值得精读,尤其是 FP8 KV 缓存布局差异(原始 vs 缩放布局)和 chunked-prefill 拆分时 KV refetch 导致 stale 数据的问题,这对 AMD 平台上的 MLA 注意力实现有借鉴意义。建议关注后续对 `get_mla_kv_buffer` 的改动,以及是否有补充 gfx950 路径测试的计划。

2026-08-14
文档 重要性 4.68 洞察度 4.00

新增 DCP 高级功能文档页并登记导航与参数

值得对 DCP 感兴趣的架构与推理团队精读,尤其是拓扑约束、LSE 合并与通信后端对比部分;对运维而言可直接复制命令示例。需要留意页面警告的启动检查缺口,文档描述的约束强于当前代码校验,建议后续在实现中补齐。

2026-08-13
缺陷修复 重要性 7.60 洞察度 4.00

回滚 Kimi K3 MLA gate 融合优化,修复长序列回归

建议快速浏览。重点阅读 kimi_k3.py 中 `_precompute_output_gate` 与 `_gated_o_proj_forward` 的协作方式,以及原 PR #33623 的融合设计(权重合并、tile_m 特例、CUDA Graph 交互)。若团队计划重新实现融合,应先在 2048 token 全序列场景补充回归测试,并厘清与 alt-stream 重叠、breakable CUDA graph 的同步语义。

性能优化 重要性 7.53 洞察度 6.00

移除 FlashInfer MLA 投机解码阻塞 D2H,吞吐提升 27%

值得精读。核心设计——为 CUDA graph 重放预置 host 数组、安装无同步 plan 函数——与既有 `fast_mla_decode_plan` 和上游 #28854 保持一致,是消除投机解码中 D2H 阻塞的典型实践。建议关注:1) 未来移除 `seq_lens_cpu` 依赖的 GPU-side plan 演进;2) 补充单元测试覆盖 verify/draft-extend 路径;3) DCP 回退路径的潜在性能优化空间。

性能优化 重要性 7.60 洞察度 6.00

Kimi-K3 融合 MLA 门投影进 QKV-A GEMM,减少一次投影 GEMM

值得精读,但建议结合后续回滚 PR#34642 一起阅读。本 PR 展示了安全的算子融合方法:通过检查 `quant_method` 与 dtype 限定未量化场景、用 `_merge_weights_as_views` 零拷贝拼接权重、以 `(gate, None)` 表达同流已算好的 gate 避免 CUDA Graph 流等待问题,并用 `SimpleNamespace` 替身做轻量 CPU 等价性测试。同时,BBuf 的独立 A/B 测试是 review 中值得借鉴的验证方式——它直接戳破了微基准与端到端收益的落差。阅读重点是 `prepare_qkv_latent` 的 fallback 分级和 `pick_tile_m` 的 wave 填充策略。