Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 21:57 同步状态:空闲 下次计划:2026-09-02 22:57

PR 列表

更多筛选
2026-06-29
缺陷修复 重要性 5.85 洞察度 4.00

NPU 上 Qwen3-VL 扩展阶段路由到 fused 算子

建议精读此 PR 以了解 NPU 上 Qwen3-VL 的精度修复方案。重点关注 `forward_prepare_npu` 对 MRoPE 的处理是否完善,建议补充针对 NPU 上 Qwen3-VL-30B 的 extend/decode 的精度与正确性测试。讨论中 AI reviewer 的质疑虽然未得到回应,但值得开发者验证。

文档 重要性 6.32 洞察度 6.00

删除冗余serve flags,更新GLM-5.2/M3部署配置

值得精读PR body中的flag决策逻辑,尤其是关于何时信任运行时默认值、何时必须显式设置(如DeepEP env)的权衡。对于维护其他cookbook配置的开发者,这是很好的参考。

重构 重要性 6.27 洞察度 5.00

清理 #29464 遗留的陈旧注释和多余 model_config 返回值

建议精读 `kv_cache_builder.py` 中 `get_draft_kv_pool` 的返回值简化,了解如何安全地清理不再使用的契约;`inspect` 用法值得在其他类似场景推广,以消除硬编码假设。

文档 重要性 5.37 洞察度 3.00

更新 Ascend NPU 最佳实践文档,与实际测试配置保持一致

推荐 NPU 平台用户和运维团队精读此 PR 的文档变更,尤其是新增的 MiMo-V2-Flash 指南。对于其他读者,可快速了解团队如何将实测配置反哺文档,体现文档与代码对齐的工程文化。

缺陷修复 重要性 4.89 洞察度 3.00

修复 ModelSlim 加载失败

该 PR 虽小但正确,值得合入。开发者应确保添加对应测试,覆盖 `get_linear_scheme` 返回 `None` 的场景,防止类似回归。

性能优化 重要性 6.22 洞察度 7.00

DFLASH verify 发布 read_done 事件加速 WAR

值得精读,特别是对理解 CUDA graph 流水线、WAR barrier 机制以及 DFLASH speculative decoding 实现有兴趣的开发者。该 PR 展示了如何通过发布细粒度事件优化 GPU 流水线重叠。

重构 重要性 9.18 洞察度 6.00

重构 weight checker 加入 ULP 量化误差容差与分块比较

建议精读 `weight_checker_comparator.py` 中的 `ComparableWeight` 设计与 `_quant_ulp` 实现,该方案为量化比较提供了理论依据。整体设计优雅,值得在类似场景复用。

参与讨论