修复 Spec V2 下 return_hidden_states 截断问题
PR 值得精读,尤其是对理解 speculative decoding 中张量布局和步幅切片的开发者。设计决策(如使用 num_correct_drafts_per_req_cpu + 1 作为接受长度、在 output_streamer 中二次截断)体现了对流水线中不同阶段语义的把握。建议合并后补充覆盖 EAGLE3 等算法的测试。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 Spec V2 下 return_hidden_states 截断问题
PR 值得精读,尤其是对理解 speculative decoding 中张量布局和步幅切片的开发者。设计决策(如使用 num_correct_drafts_per_req_cpu + 1 作为接受长度、在 output_streamer 中二次截断)体现了对流水线中不同阶段语义的把握。建议合并后补充覆盖 EAGLE3 等算法的测试。
原始 PR · 作者 sglang-bot · 合并时间 2026-06-18 07:13
sglang-kernel 版本号从 0.4.3 升至 0.4.4
该 PR 属于常规依赖更新,无需深入审查。建议合并前确认 CI 测试通过,确保新内核版本与当前代码兼容。
bench_serving 新增 --cache-report 展示缓存命中细分
该 PR 代码清晰、测试充分(通过现有 CI),适合合并。建议后续为该功能添加单元测试,确保 `_extract_cache_from_sglext` 在不同响应格式下的稳定性。审核时已注意兼容性,值得参考其安全处理 null 的方式。
回退 PR #23862 中 head_dim 赋值逻辑及对应测试
建议尽快合入以恢复 PR #23862 之前的行为。合入后应监控 CI 中相关模型(尤其是 MLA 架构)的测试是否通过,并考虑是否需补回更稳健的测试。
修复 DeepSeek-OCR-2 bench_serving 处理器加载
该 PR 改动清晰、风险低,值得合并。但建议后续补充对应 DeepSeek-OCR-2 的 benchmark 测试用例,防止回归。团队可关注 `hf_transformers_utils.get_processor` 对更多模型的处理逻辑,避免类似问题。
bench_one_batch_server 复用已有服务器,避免孤儿进程
虽然变更不大,但后续若有人扩展基准测试框架,可以借鉴 `server_is_up` 的复用模式。建议在复用已有服务器时增加模型/参数校验(如比较 model name),避免无意识跑错模型。
原始 PR · 作者 weireweire · 合并时间 2026-06-18 06:02
移除输出热路径中过时的负载收集
建议在合并前优先解决 `WatchLoadUpdateReq` 被外部包导入的兼容性问题,可以为 `smg-grpc-servicer` 提供兼容性 shim 或标记为弃用。PR 本身逻辑正确,但缺少测试覆盖,建议补充单元测试验证移除后不影响核心路径。值得关注的设计决策是清理旧 API 时需充分评估外部依赖。
原始 PR · 作者 yctseng0211 · 合并时间 2026-06-18 05:54
修复 EagleDraftExtendInput 缺少 kv_indptr 崩溃
值得合并的小修复,解决了因接口不兼容导致的崩溃问题。建议后续考虑添加类型注解 `Optional[torch.Tensor]` 以通过静态检查。
参与讨论