统一文档中NPU相关软件名称为TorchNPU
这是一次纯粹的文档标准化,可以直接合并。适合作为类似命名统一工作的参考。
SGLang is a high-performance serving framework for large language models and multimodal models.
统一文档中NPU相关软件名称为TorchNPU
这是一次纯粹的文档标准化,可以直接合并。适合作为类似命名统一工作的参考。
设备上步进 KV token 到页索引,减少 D2H 拷贝量
值得精读:展示了如何通过调整 D2H 拷贝时机来优化性能,变更量小但收益明显,适合学习性能优化思路。
修复PD分离中KV传输指标未考虑复制扇出的问题
此 PR 修复逻辑清晰,测试覆盖完整,值得阅读。设计上“在引导屏障点一次性地解析拓扑不变量并缓存”的模式可推广到其他类似场景。建议从事分离部署或分布式推理监控的开发者重点关注。
修复 Flash MLA SM120 测试导入路径
该 PR 是一个标准、低风险的后续修复,无需精读。但可作为注意力内核迁移(PR#30789)的配套变更,作为重构时需同步更新测试导入的例子。
避免 TileLang CUDA 运行时污染导致启动失败
建议精读。本 PR 展示了一种基于延迟导入和 CUDA 库选择策略来隔离不同 CUDA 运行时的有效模式。其中关于 `/proc/self/maps` 候选处理以及 NamedTuple 的设计选择值得在类似场景中复用。
原始 PR · 作者 stellaxcpeng · 合并时间 2026-07-14 22:17
修复 NPU 节点拓扑探测张量设备不匹配
建议 NPU 相关维护者精读,理解设备兼容性问题。其他后端团队可快速浏览,作为跨设备修复的参考案例。
修复 CPU 设备 topk 接口不兼容导致 CI 失败
该 PR 是快速的兼容性修复,适合合入以修复 CI。建议关注后续对 `test_spec_eagle_parity_cpu` 的修复 PR。
原始 PR · 作者 kflansburg · 合并时间 2026-07-14 20:16
修复解耦预填充语法错误导致KV双释放
值得精读。该 PR 展示了异步传输与错误处理交织时资源生命周期的细致考量,是解耦预填充稳定性的重要修复。建议关注 `to_finish` 升格问题,后续可能需跟进 PR 完善外部中止保护。
参与讨论