修复 EPLB 重平衡时权重张量非连续导致 RuntimeError
对于 NPU 平台的开发和维护人员值得关注,特别是涉及跨卡通信的 EPLB 流程;普通用户可以忽略。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 EPLB 重平衡时权重张量非连续导致 RuntimeError
对于 NPU 平台的开发和维护人员值得关注,特别是涉及跨卡通信的 EPLB 流程;普通用户可以忽略。
原始 PR · 作者 merrymercy · 合并时间 2026-07-27 06:04
为 oulgen 添加 CI 权限配置
该 PR 为常规权限管理变更,无需深入阅读。但可作为 CI 权限管理流程的参考。
原始 PR · 作者 shadowxz109 · 合并时间 2026-07-26 21:08
修复 Ascend 传输引擎初始化顺序问题
该 PR 值得快速合并,无明显设计风险。虽然未添加单元测试,但鉴于影响面极小且逻辑简单,后续可考虑添加 NPU 相关回归测试。对于维护者,了解 Ascend 库的版本兼容性处理模式即可。
Expert location 元数据加载时指定 CPU
值得合并的小修复,逻辑清晰,风险低。维护者应确保后续代码对张量设备位置的处理正确。
为 NPU 添加 native buffer 填充,修复 triton 内核及 disagg 参数错误
建议 NPU 相关开发者精读,尤其是 `fill_draft_extend_prepare_buffers_native` 的实现方式与条件导入技巧。对于非 NPU 开发者可跳过。后续应考虑为 Native 实现补充单元测试,并与 Triton 版本持续保持行为对标。
为 NPU Ascend attention 后端添加 CPU 单元测试
建议直接合并。此 PR 填补了 NPU 后端的单元测试空白,且采用了的 mock/stub 模式值得学习。测试结构清晰,覆盖全面,CI 配置合理。
修复 TBO 开启 return_logprob 时的崩溃
该 PR 变更极小但关键,属于典型边界条件 bugfix,值得快速合入。建议后续为该逻辑添加单元测试,防止类似遗漏。
禁用Qwen3.5在MoRI+dp-attention下的融合专家
值得精读。该 PR 清晰展示了模型架构(Qwen 全局槽位设计)与通信后端(MoRI per-rank 槽位设计)之间的不兼容问题,以及如何在模型代码层优雅地检测和回退。设计决策(保留独立 MLP 路径而非强制适配 per-rank 槽位)是务实的权衡,适合作为跨模块冲突处理的参考案例。
参与讨论