复用 bootstrap HTTP 会话避免端口耗尽
建议快速合入。本 PR 以极小的代码改动(仅一个文件)解决了 PD 部署中严重的生产问题,A/B 验证数据充分。值得关注的设计决策:使用 `threading.local()` 保证 Session 线程安全、小连接池(pool=1)避免资源浪费。
SGLang is a high-performance serving framework for large language models and multimodal models.
复用 bootstrap HTTP 会话避免端口耗尽
建议快速合入。本 PR 以极小的代码改动(仅一个文件)解决了 PD 部署中严重的生产问题,A/B 验证数据充分。值得关注的设计决策:使用 `threading.local()` 保证 Session 线程安全、小连接池(pool=1)避免资源浪费。
原始 PR · 作者 stellaxcpeng · 合并时间 2026-07-27 19:19
修复 NPU PD 下 MTP IndexShare 的 warm-up 挂起与 CP top-k 形状错误
建议精读 `can_run_graph()` 的实现,尤其是通过 all-reduce 同步跨 rank 决策的模式,这种模式在异构硬件或分布式 warm-up 场景中具有通用性。代码注释充分,commit 历史清晰,适合作为 NPU 调试的参考。
原始 PR · 作者 merrymercy · 合并时间 2026-07-27 19:09
整理 server_args.py 常量分组并移除无用别名
值得快速浏览,了解 server_args.py 的结构改进,尤其适合关注代码整洁性的读者。
原始 PR · 作者 ShangmingCai · 合并时间 2026-07-27 18:15
修复 DeepSeek-V4 严格思考模式无法正确屏蔽 EOS
建议合并。该 PR 修复了 DeepSeek-V4 的一个关键 bug,代码简洁、测试完善。值得关注的是 `DeepSeekV4Detector` 的设计模式:直接继承 `BaseReasoningFormatDetector` 而非复用其他模型的 detector,避免了 token 不兼容问题,这是处理特殊 tokenizer 模型的正确做法。
优化 EmbeddingGemma prefill 性能,BCG 加速 4.37 倍
建议精读。该 PR 展示了如何将 encoder-only 模型适配到 SGLang 的 BCG 框架中,包括残差融合、批次 tokenization、注意力窗口正确性等关键设计。`layernorm.py` 中的融合 RMSNorm 内核设计值得复用。`server_args.py` 中的自动配置逻辑也可作为其他特殊模型配置的参考。
原始 PR · 作者 zhendonghua · 合并时间 2026-07-27 15:49
bare Qwen3Model 原生嵌入适配,吞吐提升 32%
PR 质量高,包含详尽的性能与准确性测试。实现模式(包装骨干 + Pooler + 手动 prefix remap)可供其他 embedding 模型注册参考。建议合并。
修复 NPU 上 AfmoE topk 重构导致的精度回退
建议合并。该 PR 修复了由重构引起的精度退化,改动量小且聚焦于 NPU 特判逻辑,讨论中已充分验证。但建议后续增加针对 NPU 下 AfmoE topk 参数传递的单元测试,防止类似回归。
根据 scoring_func 动态选择 NPU topk norm_type,修复 DS coder v2 精度
建议合并。这是一个针对特定回归的精准修复,改动量小且逻辑清晰。后续可在 NPU 文档中补充 scoring_func 参数说明。
参与讨论