Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-04-24

#23454 [srt] Add Moss-VL Python runtime support

原始 PR · 作者 zsj555 · 合并时间 2026-04-24 11:14

功能 重要性 9.18 洞察度 7.00

新增 Moss-VL 多模态模型 SRT 运行时支持

该 PR 值得精读,特别是交叉注意力自定义掩码的实现、`prepare_forward_batch` 钩子模式、以及如何在现有调度框架中扩展多模态模型。建议关注性能优化的后续工作(如向量化位置插值和分隔符插入)。

功能 重要性 7.95 洞察度 6.00

XPU流水线并行支持,修复死锁

建议精读此 PR,尤其关注设备无关化模式和奇偶排序的设计,对多硬件后端支持有借鉴意义。可快速合并。

功能 重要性 7.38 洞察度 7.00

新增MUSA GPU后端对DeepSeek模型的完整支持

此 PR 为多后端适配的典范,值得详细审查。重点关注 `_is_musa()` 守卫模式、`forward_musa` 方法的分发逻辑以及 DeepGEMM 的 MUSA 绕过策略。建议在合并后尽快补充 MUSA CI 测试,并关注 `FP8` 量化和 `page_size` 相关未解决讨论。

#23547 [Intel CPU/XPU] SGL doc updates

原始 PR · 作者 ZailiWang · 合并时间 2026-04-24 09:23

文档 重要性 3.84 洞察度 2.00

更新Intel CPU/XPU文档,适配新CLI入口并添加XPU Docker指南

建议合并后添加提交修复xpu.mdx中缺少的`--host 0.0.0.0`参数。值得关注的变更:统一CLI入口的文档迁移,以及XPU Docker支持的正式文档化。

#23528 [CPU] remove RECORD_FUNCTION

原始 PR · 作者 mingfeima · 合并时间 2026-04-24 09:18

性能优化 重要性 5.73 洞察度 2.00

移除CPU内核中的RECORD_FUNCTION宏,消除重复Profiling记录

本PR属于常规维护,建议快速合并。变更简单且无风险,但值得记录在开发指南中:当内核通过torch.ops注册时,不应使用`RECORD_FUNCTION`宏。

性能优化 重要性 6.80 洞察度 6.00

缓存BatchedDecodeContext中的派生张量,消除每层重复计算

值得精读。这是一个小而精的性能优化示例,展示了如何通过数据缓存减少冗余计算和主机-设备拷贝,对MLX后端推理性能有明显提升。同时体现了如何通过review迭代采纳建议,最终实现更优方案。对于其他后端的类似模式有参考价值。

功能 重要性 7.57 洞察度 6.00

移植 CUDA 内核到 MUSA,支持 Moore Threads GPU

**建议精读**:重点关注 `common_extension_musa.cc` 和 `setup_musa.py` 以理解 MUSA 算子注册机制;`fused_add_rms_norm_kernel.mu` 展示了 MUSA 内联汇编和 warp 同步模式;`custom_all_reduce.cuh` 中的多后端条件编译策略值得参考。开发者需注意 MUSA 专用代码的维护成本。

#23576 [diffusion] CI: minor refactor CI

原始 PR · 作者 mickqian · 合并时间 2026-04-24 08:48

重构 重要性 5.50 洞察度 4.00

简化扩散测试用例组织结构,合并列表并重命名文件

该PR属于常规维护重构,不涉及功能变更。建议阅读`gpu_cases.py`和`diffusion_case_parser.py`的变更,了解测试组织方式的新约定。"1-gpu-b200"测试套件的文件引用已更新,注意保持同步。

参与讨论