#23972 fix the compatibility between --moe-dense-tp-size 1 and piecewise cuda graph
原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-04-30 17:12
修复 piecewise CUDA graph 与 MoE dense TP 的兼容性
值得精读,特别是关注 MoE 并行策略与 CUDA graph 捕获兼容性的开发者。设计简单且可维护。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-04-30 17:12
修复 piecewise CUDA graph 与 MoE dense TP 的兼容性
值得精读,特别是关注 MoE 并行策略与 CUDA graph 捕获兼容性的开发者。设计简单且可维护。
原始 PR · 作者 opherlieber · 合并时间 2026-04-30 16:12
修复边界条件,允许总 token 数等于 context_len 的请求
可以快速合并。变更简单安全,建议添加单元测试覆盖边界情况以确保未来重构时不会回归。
原始 PR · 作者 yushengsu-thu · 合并时间 2026-04-30 16:11
修复LoRA CUDA graph中seg_indptr标量赋值导致的同步点
值得快速合并,但建议在后续 PR 中补充 CUDA graph 兼容性测试,避免类似回归。
原始 PR · 作者 JamesBrianD · 合并时间 2026-04-30 15:39
删除 sgl-jax TPU 部署文档中的无效参数
该 PR 是典型的文档 bugfix,逻辑简单,值得快速合入。无需精读源码。
原始 PR · 作者 billishyahao · 合并时间 2026-04-30 14:57
为AMD MoRI EP添加SDMA路径支持
该PR提供了明确的硬件加速路径,设计简洁,值得AMD相关开发者关注。建议合并后补充单元测试覆盖SDMA路径的dispatch/combine逻辑,并考虑增加版本检测以增强鲁棒性。
重构 Moss-VL 视觉编码器,替换 Conv3d 并移除死代码
该 PR 是低风险的小范围重构,值得合并。但建议同步更新或添加相关测试(尤其是视觉特征收集流程),以防范未来潜在的回归。
修复 Qwen3.5 FP8 per-tensor 量化权重加载崩溃
值得精读。本 PR 虽改动量小,但精准解决了量化模型权重加载中的语义差异:per-tensor scale 是全局标量应当广播,而非常规张量的分割。Review 建议的代码合并方式(统一 `numel()==1` 分支)也值得借鉴,它消除了断言限制并提升了可读性。新增测试的设计思路(直接 mock 类方法和参数)可作为类似测试的模板。
为 XPU 操作添加确定性模式
值得精读,特别是 `batch_invariant_ops.py` 中通过 `get_dispatch_device_backend` 实现多后端调度的设计模式,以及 layernorm 中条件分支的编写方式,对后续扩展其他硬件有参考意义。PR 表明团队在为 Intel XPU 提供一阶支持,建议关注后续 intel_dev 分支的集成情况。
参与讨论