#21197 [NPU]adaptation to support deterministic inference
原始 PR · 作者 Estrella-xx · 合并时间 2026-06-09 09:22
NPU 后端确定性推理适配
值得精读,特别是 `npu_batch_invariant_ops.py` 和 `batch_invariant_ops.py` 中的条件注册逻辑,展示了如何在 SGLang 框架中为不同硬件后端提供操作符替换。采样器中的种子化改造也是一个可重用的模式。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 Estrella-xx · 合并时间 2026-06-09 09:22
NPU 后端确定性推理适配
值得精读,特别是 `npu_batch_invariant_ops.py` 和 `batch_invariant_ops.py` 中的条件注册逻辑,展示了如何在 SGLang 框架中为不同硬件后端提供操作符替换。采样器中的种子化改造也是一个可重用的模式。
原始 PR · 作者 Jianhong-Zhang · 合并时间 2026-06-09 09:18
修复 XPU NIXL 地址溢出问题
值得精读,尤其是在 Intel XPU 上运行分离式推理的团队。展示了 NumPy 类型提升陷阱以及如何处理高 64 位地址。
将 1.3MB 的 tokenizer 测试 fixture 缩小为几 KB
这个 PR 是测试基础设施的清理工作,值得所有关注仓库健康度的开发者了解。它展示了如何在不影响测试覆盖的前提下,通过细心分析测试依赖来安全地移除大型二进制/JSON 文件。
原始 PR · 作者 Zhiy-Zhang · 合并时间 2026-06-09 08:14
修复 FA3 EAGLE draft decode 的 page_table scatter OOB
本 PR 已合并,无需额外操作。建议开发者在涉及 FA3 后端和 speculative decoding 时,关注 #27360 的修复逻辑,并确保类似场景在其他后端也得到测试。
规范 Spec V2 代码命名,accepted→accept,page_size_1→contiguous
此 PR 是代码规范化的良好实践,值得精读以理解团队命名约定。对于关注 speculative decoding 的实现细节的工程师,重命名后的函数名更易理解其语义(accept 而非 accepted)。
融合 Spec 中 4 个 gather 算子,TPOT 提升 1-2%
值得精读,展示了如何用 Triton 手动融合 gather 操作绕过 torch.compile 融合限制,并附有高质量的测试设计,可作为 Triton kernel 开发的范例。
重命名函数并删除废弃的 Spec V1 辅助代码
该 PR 为常规清理维护,值得简要了解其删除逻辑,确认无意外引用即可快速合并。不包含复杂设计决策,无需深入阅读。
支持 DSV4 DP Attention 可断点 CUDA 图
建议所有 DeepSeek V4 相关开发者精读此 PR,重点关注: 1. `DSV4AttnMetadata.refresh_for_breakable_cuda_graph_replay_` 中的字段分类设计,这是图捕获地址稳定的核心。 2. BCG 运行器中 DP rank 同步保护的模式,可复用于其他分布式后端。 3. 注意力后端接口的扩展方式,后续为其他模型添加 BCG 支持时可参考 `DeepseekV4AttnBackend` 的 opt-in 实现。 对于运维团队,建议先在低风险预发布环境进行 A/B 性能对比,确认工作负载符合预期后再推广。
参与讨论