bench_one_batch_server 复用已有服务器,避免孤儿进程
虽然变更不大,但后续若有人扩展基准测试框架,可以借鉴 `server_is_up` 的复用模式。建议在复用已有服务器时增加模型/参数校验(如比较 model name),避免无意识跑错模型。
SGLang is a high-performance serving framework for large language models and multimodal models.
bench_one_batch_server 复用已有服务器,避免孤儿进程
虽然变更不大,但后续若有人扩展基准测试框架,可以借鉴 `server_is_up` 的复用模式。建议在复用已有服务器时增加模型/参数校验(如比较 model name),避免无意识跑错模型。
原始 PR · 作者 weireweire · 合并时间 2026-06-18 06:02
移除输出热路径中过时的负载收集
建议在合并前优先解决 `WatchLoadUpdateReq` 被外部包导入的兼容性问题,可以为 `smg-grpc-servicer` 提供兼容性 shim 或标记为弃用。PR 本身逻辑正确,但缺少测试覆盖,建议补充单元测试验证移除后不影响核心路径。值得关注的设计决策是清理旧 API 时需充分评估外部依赖。
原始 PR · 作者 yctseng0211 · 合并时间 2026-06-18 05:54
修复 EagleDraftExtendInput 缺少 kv_indptr 崩溃
值得合并的小修复,解决了因接口不兼容导致的崩溃问题。建议后续考虑添加类型注解 `Optional[torch.Tensor]` 以通过静态检查。
原始 PR · 作者 sglang-bot · 合并时间 2026-06-18 04:38
sgl-kernel 版本号从 0.4.3 升至 0.4.4
变更简单明确,可直接合并。建议在合并前确认 sgl-kernel 0.4.4 版本包已成功构建并上传到相关仓库。
升级 FA3 hash 并支持 only_qv 模式
推荐阅读 `sgl-kernel/python/sgl_kernel/flash_attn.py` 中 `only_qv` 的实现,了解如何在不改变内核 API 的情况下通过填充空张量跳过计算路径。该设计模式在类似场景(如条件性跳过某些 matmul)中有参考价值。同时,构建配置的智能化(根据平台开关 FA3)值得在其他 CUDA 特性中推广。
原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-06-18 04:25
修复 draft-extend 阶段 mrope_positions 崩溃
建议精读。该 PR 修正了一个明确的运行时崩溃,修复逻辑清晰,通过新增分支复用已有方法,设计简洁。值得关注的是如何通过函数签名扩展(添加可选参数)来统一不同阶段的 mrope 位置计算。
原始 PR · 作者 LijuanTang94 · 合并时间 2026-06-18 04:06
新增 Apple Silicon Metal 性能分析后端
值得精读。该 PR 展示了如何通过 backend patch 模式在 SGLang 中为新型硬件添加 profiling 支持,设计思路清晰,与已有 NPU 后端一致,可作为跨后端扩展的参考模板。对于 Apple Silicon 开发人员,还提供了详细的用法和验证结果。
修复 EAGLE3 aux 捕获在 AR 融合下的 per-rank 碎片问题
值得精读,特别是 `_post_attn_residual_is_read_only` 的设计模式可作为类似 fusion-pass 中捕获正确状态的范例。建议合并前确认是否有针对 TP>1 的集成测试覆盖,后续可考虑添加。
参与讨论