融合算子加速 NPU Wan 推理 2%-10%
该 PR 展示了如何为 NPU 后端添加融合算子路径,具有参考价值。但 review 中的重构建议未被采纳,对于追求高代码质量的团队尤其值得注意。整体改动较小,建议关注其中的模式设计。
SGLang is a high-performance serving framework for large language models and multimodal models.
融合算子加速 NPU Wan 推理 2%-10%
该 PR 展示了如何为 NPU 后端添加融合算子路径,具有参考价值。但 review 中的重构建议未被采纳,对于追求高代码质量的团队尤其值得注意。整体改动较小,建议关注其中的模式设计。
原始 PR · 作者 HanHan009527 · 合并时间 2026-05-11 11:18
H20 CI 阶段默认 CUDA 版本升级至 13.0
该 PR 为简单的 CI 配置修复,无需精读代码。但体现了团队维护 CI 环境同步的务实做法,对于关注 CI 稳定性的读者有参考价值。
原始 PR · 作者 yctseng0211 · 合并时间 2026-05-11 11:08
为 AMD 夜间测试增加 VRAM 清理步骤
建议合并此 PR。它是 CI 质量的常规维护,与 PR 测试工作流的行为对齐,能有效提升夜间测试的可靠性。对于需要维护 CI 管线的团队,本 PR 的改动模式(在容器启动前清理 VRAM)值得在其他类似场景(如共享 runner 的多租户环境)中参考。
原始 PR · 作者 yctseng0211 · 合并时间 2026-05-11 10:55
为 AMD CI lmms-eval 安装增加重试与安全目录
建议精读此 PR,它展示了处理 CI 中网络瞬态故障和 git 权限问题的典型模式。`git_clone_with_retry` 和 `docker cp` + `safe.directory` 的组合可复用于类似场景。
原始 PR · 作者 iridiumine · 合并时间 2026-05-11 09:53
NPU MTP warmup 因 padding token 维度不匹配崩溃修复
值得合入,修复明确且验证充分。review 中的建议(使用 `forward_batch.batch_size`)可作为后续优化参考,但不影响当前正确性。
NPU FIA 算子多批处理优化,替代逐序列循环
建议阅读该 PR,了解 NPU 注意力优化如何利用 CANN 多 batch 特性。关注 fia_mask 硬编码问题,后续可能需要提 PR 修复。设计决策——用 TND 布局替换 BSND 并处理 padding——值得参考。
原始 PR · 作者 silencejade · 合并时间 2026-05-11 09:43
修复 NPU 推测解码中 mrope_position 竞态条件
值得精读。展示了异步流竞态修复的典型模式:在等待流同步后重新计算依赖值,并正确同步到 CUDA graph buffer。对理解 speculative decoding 中的流管理和 CUDA graph 缓冲有参考价值。
原始 PR · 作者 silencejade · 合并时间 2026-05-11 09:40
NPU 启用 Qwen3.5 前缀缓存支持
PR 改动简单明确,建议直接合并。有兴趣了解 NPU 端 mamba 调度策略演进的人员可以关注后续针对 NPU 的测试文档更新。
参与讨论