#28757 [AMD] [GLM5] skip redundant -inf pre-fill of HIP indexer MQA-logits
原始 PR · 作者 Raiden-Makoto · 合并时间 2026-06-25 14:21
跳过冗余 -inf 预填充以加速 HIP DSA 预填充
该 PR 体现了通过参数对齐消除冗余计算的典型优化手段,且提供了详尽的基准测试和单元测试验证。对于关注 AMD 平台长上下文推理性能的开发者,值得精读。设计决策值得在其他类似场景中借鉴。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 Raiden-Makoto · 合并时间 2026-06-25 14:21
跳过冗余 -inf 预填充以加速 HIP DSA 预填充
该 PR 体现了通过参数对齐消除冗余计算的典型优化手段,且提供了详尽的基准测试和单元测试验证。对于关注 AMD 平台长上下文推理性能的开发者,值得精读。设计决策值得在其他类似场景中借鉴。
NPU GDN 预填充中预计算 mamba 跟踪索引
值得合并的优化,改动量小、收益明确、验证充分。可作为 NPU 后端预填充性能优化的参考模式。
为 MiMo V2.5 添加 Blackwell Vision FA4 配方
该 PR 是配置修复和文档更新,值得参考其处理多模态后端兼容性问题的方式。
支持BF16 LoRA快速路径并修复EP+CUDA图崩溃
建议团队关注 BF16 路径的性能差异,可考虑添加单元测试覆盖数值正确性。该 PR 的二流重叠设计决策(gate_up LoRA 并发的度、down LoRA 保持串行)值得学习,但需注意 CUDA graph 捕获期间的 event 管理。
原始 PR · 作者 wenxuewuhd · 合并时间 2026-06-25 11:44
修复 NPU 上 DLLM 启用 radix cache 时页面大小不同步问题
该 PR 改动极小但修复了关键的一致性问题,建议合并。可快速阅读理解,无需精读全部文件。
调低 Gemma4 26B-A4B 在 B200 上的内存比例
对于部署 Gemma4 26B-A4B 在 B200 上的用户,建议采用此配置;对于其他模型或硬件组合,无影响。
原始 PR · 作者 JessicaJiang-123 · 合并时间 2026-06-25 11:27
为 AMD MI35x 添加 ROCm 7.0 夜间 Docker 构建
该 PR 是常规基础设施变更,无技术难度,但为解决 MI35x 实际问题的必要操作。值得关注的是其依赖的基础镜像 `v0.5.10-rocm700-mi35x` 的维护状况。
原始 PR · 作者 Ronnie-Rui · 合并时间 2026-06-25 11:18
修复 diffusion LLM 禁用 PP 条件取反
该 PR 变更简单且关键,值得快速合并。建议阅读 `_handle_dllm_inference()` 方法以理解 diffusion LLM 推理下的参数覆盖模式,并检查其他类似 `if not` 模式是否存在类似反转问题。
参与讨论