Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 03:32 同步状态:空闲 下次计划:2026-09-05 04:32

PR 列表

更多筛选
2026-07-15

重构 NPU MoE 为 5 组件解耦,对齐社区 All-to-All 架构

建议所有 NPU 后端开发者深度阅读此 PR,尤其是 5 组件的接口设计(`base.py` 中的 `MoeRunnerCore` 及其子类)和 `AscendTPDispatcher` 的 `dispatch` 流程。review 中关于循环导入的教训也值得其他模块借鉴。PR 本身合并后需密切监控 NPU MoE 各项 CI job 的稳定性。

#30621 Fix image URL response for multiple outputs

原始 PR · 作者 AuFlow · 合并时间 2026-07-15 19:49

缺陷修复 重要性 8.75 洞察度 5.00

修复多输出时 URL 只返回单个的问题,新增 variant 回退支持

此 PR 值得精读,原因: - 清晰的变体索引设计,通过列表和索引映射处理多输出。 - 良好的回退逻辑,兼容旧数据结构。 - 并发上传优化和明确的错误提示。 - 测试覆盖全面(8 个用例)。 建议关注 `_build_image_response_kwargs` 中 url 分支的循环构建方式,以及下载端点如何使用辅助函数处理 variant。

#30904 feat: unify multimodal feature transport

原始 PR · 作者 mickqian · 合并时间 2026-07-15 17:42

功能 重要性 7.87 洞察度 6.00

统一多模态特征传输,新增 --mm-feature-transport 参数

建议技术管理者关注此 PR 中的配置迁移模式,特别是 `_handle_multimodal_feature_transport` 方法中向后兼容的处理逻辑,可作为类似场景的参考。工程师应重点阅读 `server_args.py` 中的解析逻辑和 `base_processor.py` 中从全局变量到实例属性的转变,理解如何安全地废弃旧配置。

#30748 Route PD server warmup to every DP rank

原始 PR · 作者 weireweire · 合并时间 2026-07-15 15:59

缺陷修复 重要性 7.66 洞察度 5.00

显式路由PD warmup到每个DP rank,修复覆盖不全问题

值得精读。设计上使用显式路由到每个DP rank、并通过`asyncio.gather`并发控制,是典型的批量初始化模式。建议关注`return_exceptions`讨论,根据实际容错需求决定是否添加。

#31289 [CI] Lower GLM-5.2 NVFP4 MTP speed threshold

原始 PR · 作者 mmangkad · 合并时间 2026-07-15 15:39

其他 重要性 3.68 洞察度 3.00

降低 GLM-5.2 NVFP4 MTP CI 速度阈值

变更合理且必要,直接解决 CI 误报问题。建议阅读者关注 PR#31001 的回退计划(flashinfer v0.5.15),届时可能需要再次调整阈值或恢复原值。

缺陷修复 重要性 5.62 洞察度 5.00

NPU MoE topk norm_type 根据 scoring_func 动态选择,修复精度

该 PR 为 pinpoint bugfix,改动虽小但修复了重要精度问题。建议相关开发者关注 NPU MoE topk 路径对 scoring_func 的依赖,并在新增模型时显式指定 scoring_func。值得阅读以了解 NPU topk 的配置方式。

缺陷修复 重要性 5.90 洞察度 3.00

修复 object-storage 模型路径的 processor 加载

值得快速合入,变更微小且逻辑清晰。推荐了解 object-storage 缓存机制的读者留意 resolve_runai_obj_uri 的实现;其他读者可直接合并。

参与讨论