Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 23:02 同步状态:空闲 下次计划:2026-09-03 00:02

PR 列表

更多筛选
2026-07-27

#31543 [PD] pool decode bootstrap HTTP sessions

原始 PR · 作者 inkcherry · 合并时间 2026-07-27 21:07

缺陷修复 重要性 7.20 洞察度 6.00

复用 bootstrap HTTP 会话避免端口耗尽

建议快速合入。本 PR 以极小的代码改动(仅一个文件)解决了 PD 部署中严重的生产问题,A/B 验证数据充分。值得关注的设计决策:使用 `threading.local()` 保证 Session 线程安全、小连接池(pool=1)避免资源浪费。

缺陷修复 重要性 6.44 洞察度 5.00

修复 NPU PD 下 MTP IndexShare 的 warm-up 挂起与 CP top-k 形状错误

建议精读 `can_run_graph()` 的实现,尤其是通过 all-reduce 同步跨 rank 决策的模式,这种模式在异构硬件或分布式 warm-up 场景中具有通用性。代码注释充分,commit 历史清晰,适合作为 NPU 调试的参考。

缺陷修复 重要性 6.85 洞察度 5.00

修复 DeepSeek-V4 严格思考模式无法正确屏蔽 EOS

建议合并。该 PR 修复了 DeepSeek-V4 的一个关键 bug,代码简洁、测试完善。值得关注的是 `DeepSeekV4Detector` 的设计模式:直接继承 `BaseReasoningFormatDetector` 而非复用其他模型的 detector,避免了 token 不兼容问题,这是处理特殊 tokenizer 模型的正确做法。

#32383 Optimize EmbeddingGemma prefill performance

原始 PR · 作者 mickqian · 合并时间 2026-07-27 17:34

性能优化 重要性 8.60 洞察度 7.00

优化 EmbeddingGemma prefill 性能,BCG 加速 4.37 倍

建议精读。该 PR 展示了如何将 encoder-only 模型适配到 SGLang 的 BCG 框架中,包括残差融合、批次 tokenization、注意力窗口正确性等关键设计。`layernorm.py` 中的融合 RMSNorm 内核设计值得复用。`server_args.py` 中的自动配置逻辑也可作为其他特殊模型配置的参考。

缺陷修复 重要性 6.35 洞察度 4.00

修复 NPU 上 AfmoE topk 重构导致的精度回退

建议合并。该 PR 修复了由重构引起的精度退化,改动量小且聚焦于 NPU 特判逻辑,讨论中已充分验证。但建议后续增加针对 NPU 下 AfmoE topk 参数传递的单元测试,防止类似回归。

缺陷修复 重要性 5.59 洞察度 3.00

根据 scoring_func 动态选择 NPU topk norm_type,修复 DS coder v2 精度

建议合并。这是一个针对特定回归的精准修复,改动量小且逻辑清晰。后续可在 NPU 文档中补充 scoring_func 参数说明。

参与讨论