NPU GDN 预填充中预计算 mamba 跟踪索引
值得合并的优化,改动量小、收益明确、验证充分。可作为 NPU 后端预填充性能优化的参考模式。
SGLang is a high-performance serving framework for large language models and multimodal models.
NPU GDN 预填充中预计算 mamba 跟踪索引
值得合并的优化,改动量小、收益明确、验证充分。可作为 NPU 后端预填充性能优化的参考模式。
为 MiMo V2.5 添加 Blackwell Vision FA4 配方
该 PR 是配置修复和文档更新,值得参考其处理多模态后端兼容性问题的方式。
支持BF16 LoRA快速路径并修复EP+CUDA图崩溃
建议团队关注 BF16 路径的性能差异,可考虑添加单元测试覆盖数值正确性。该 PR 的二流重叠设计决策(gate_up LoRA 并发的度、down LoRA 保持串行)值得学习,但需注意 CUDA graph 捕获期间的 event 管理。
原始 PR · 作者 wenxuewuhd · 合并时间 2026-06-25 11:44
修复 NPU 上 DLLM 启用 radix cache 时页面大小不同步问题
该 PR 改动极小但修复了关键的一致性问题,建议合并。可快速阅读理解,无需精读全部文件。
调低 Gemma4 26B-A4B 在 B200 上的内存比例
对于部署 Gemma4 26B-A4B 在 B200 上的用户,建议采用此配置;对于其他模型或硬件组合,无影响。
原始 PR · 作者 JessicaJiang-123 · 合并时间 2026-06-25 11:27
为 AMD MI35x 添加 ROCm 7.0 夜间 Docker 构建
该 PR 是常规基础设施变更,无技术难度,但为解决 MI35x 实际问题的必要操作。值得关注的是其依赖的基础镜像 `v0.5.10-rocm700-mi35x` 的维护状况。
原始 PR · 作者 Ronnie-Rui · 合并时间 2026-06-25 11:18
修复 diffusion LLM 禁用 PP 条件取反
该 PR 变更简单且关键,值得快速合并。建议阅读 `_handle_dllm_inference()` 方法以理解 diffusion LLM 推理下的参数覆盖模式,并检查其他类似 `if not` 模式是否存在类似反转问题。
回退 Gemma4 modelopt fp4 MoE 注意力后端默认值
该 PR 是配合上游修复的配置回归,变更简单直接,值得了解但对工程师学习价值有限。用于确认依赖修复完成后恢复默认配置的流程。
参与讨论