Prhub

sgl-project/sglang · 标签视图

标签列表

聚合结果

dcp 相关 PR

2026-08-25
缺陷修复 重要性 5.11 洞察度 5.00

修复 Qwen3.8-MXFP4 DCP 启动失败,注册文本架构到 mamba 白名单

该 PR 值得快速浏览,它揭示了一个架构白名单与 DCP 配置交互的 bug。建议精读 `_MAMBA_EXTRA_BUFFER_ARCHS` 列表,了解各架构的内存模型约束。未来应考虑为纯文本架构增加单元测试,确保白名单同步。

2026-08-13
性能优化 重要性 6.68 洞察度 6.00

融合 DCP a2a 的 LSE 打包拷贝,减少 MLA 解码路径四次拷贝

建议对 DCP/a2a 通信优化或 Triton kernel 设计感兴趣的读者精读本 PR:`dcp_pack_a2a_send` 以 fp32 word 为单位跨 dtype 复用内核的选择、接收端零拷贝视图的写法,以及作者对“CUDA graph 路径实际只有测试覆盖”的观察都很有价值;测试中用 `uint8` 视图做逐位比较的做法也值得在其他 bit-exact 内核验证中复用。若你在维护 `forward_mla.py` / `forward_mla_rocm.py`,可以跟进清理 `cuda_graph_buffers` 死路径问题。

2026-08-04
缺陷修复 重要性 5.67 洞察度 4.00

DCP 按聚合 KV 池限制请求长度

值得精读:这是理解 SGLang DCP 计费模型(per-rank 池 vs 聚合池)的一个极佳切入点,`scheduler.py` 中与 `PrefillAdder` 一致性相关的注释值得注意。建议合入后补充一个 `dcp_size > 1` 的准入与 `max_new_tokens` 预算单元测试,并顺手核对 `PrefillAdder` 的准入预算是否同样基于聚合池,防止未来出现新的口径分裂。

缺陷修复 重要性 5.11 洞察度 4.00

修复 DCP 下 MLA KV 越界检查误报

建议阅读该 PR 以理解 DCP 下逻辑索引与物理索引空间的口径差异。修复本身非常直接,但思路值得借鉴——在 DCP 或任何跨卡并行场景中,OOB 检查必须与内核实际的索引映射保持一致。可顺带排查 memory_pool.py 中其他使用物理容量做上界的断言(如 get 路径)是否存在类似误报风险。