#23819 [NPU] Fix warmup error with --disable-cuda-graph and mtp
原始 PR · 作者 iridiumine · 合并时间 2026-05-11 09:53
NPU MTP warmup 因 padding token 维度不匹配崩溃修复
值得合入,修复明确且验证充分。review 中的建议(使用 `forward_batch.batch_size`)可作为后续优化参考,但不影响当前正确性。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 iridiumine · 合并时间 2026-05-11 09:53
NPU MTP warmup 因 padding token 维度不匹配崩溃修复
值得合入,修复明确且验证充分。review 中的建议(使用 `forward_batch.batch_size`)可作为后续优化参考,但不影响当前正确性。
NPU FIA 算子多批处理优化,替代逐序列循环
建议阅读该 PR,了解 NPU 注意力优化如何利用 CANN 多 batch 特性。关注 fia_mask 硬编码问题,后续可能需要提 PR 修复。设计决策——用 TND 布局替换 BSND 并处理 padding——值得参考。
原始 PR · 作者 silencejade · 合并时间 2026-05-11 09:43
修复 NPU 推测解码中 mrope_position 竞态条件
值得精读。展示了异步流竞态修复的典型模式:在等待流同步后重新计算依赖值,并正确同步到 CUDA graph buffer。对理解 speculative decoding 中的流管理和 CUDA graph 缓冲有参考价值。
原始 PR · 作者 silencejade · 合并时间 2026-05-11 09:40
NPU 启用 Qwen3.5 前缀缓存支持
PR 改动简单明确,建议直接合并。有兴趣了解 NPU 端 mamba 调度策略演进的人员可以关注后续针对 NPU 的测试文档更新。
修复确定性推理未禁用 FlashInfer allreduce 融合的问题
该 PR 值得合并,修复了重要的回归问题。建议阅读其设计思路:通过提前设置强制禁用标记来拦截模型特定调整逻辑,是一种简洁且健壮的模式,可推广到类似场景。
原始 PR · 作者 brian030128 · 合并时间 2026-05-11 08:48
修复目标/草稿隐藏层大小不匹配时的推测解码崩溃
值得精读,特别是对推测解码内部形状管理的分析。展示了如何诊断和修复一个 phase 边界上的形状问题。建议关注 decode 与 extend 阶段不同形状处理的决策逻辑,以及未来可能的清除计划。
修复非 NVLink 场景下 CUDA graph 捕获崩溃
这是一个高信号、低风险的 bugfix,建议尽快合并并 cherry-pick 到涉及 PR #24363 的版本分支。对于 `sglang` 的定制通信层开发者,`capture()` 的 guard 模式值得参考,以确保 future 的类似 `disabled` 分支保持一致。
修复 SUM_LEN 模式下 reduce_scatterv 合约错误
建议精读该 PR 以理解 DP reduce_scatterv 生产合约的关键设计思路。这是一个典型的生产合约 Bug,修复逻辑清晰但影响重大,值得作为分布式推理中通信合约设计的案例研究。
参与讨论