统一 bench seed 默认值并重命名 profile 参数
本 PR 为低风险的机械性清理,可直接通过。若团队有依赖默认 seed=1 的自动化基准测试,需注意结果可能微变,但通常 42 更规范。建议在后续 PR 中进一步统一其他参数名称(如 `result-filename` 等)。
SGLang is a high-performance serving framework for large language models and multimodal models.
统一 bench seed 默认值并重命名 profile 参数
本 PR 为低风险的机械性清理,可直接通过。若团队有依赖默认 seed=1 的自动化基准测试,需注意结果可能微变,但通常 42 更规范。建议在后续 PR 中进一步统一其他参数名称(如 `result-filename` 等)。
为Gemma4添加DFlash推测解码支持
值得精读该 PR,尤其是 dflash_worker_v2.py 中的采样逻辑改动:如何优雅地处理不同类型 LM head(有/无 shard_indices),以及测试脚本如何通过 `/server_info` 校验 spec 配置和 acceptance length。建议后续类似功能的实现可以遵循这种模式。
trtllm_mha 后端移除 CPU seq_lens 同步,提升推测解码性能
**值得精读**:该 PR 清晰地展示了一个通过设备端计算替代主机端同步的经典优化案例。设计决策(静态上界、设备端保护、Python 包装器)和 review 中的讨论(eager 路径同步移除)都很有参考价值。对于理解 SGLang 注意力后端的同步模型和推测解码优化很有帮助。
修复 Spec V2 下 return_hidden_states 截断问题
PR 值得精读,尤其是对理解 speculative decoding 中张量布局和步幅切片的开发者。设计决策(如使用 num_correct_drafts_per_req_cpu + 1 作为接受长度、在 output_streamer 中二次截断)体现了对流水线中不同阶段语义的把握。建议合并后补充覆盖 EAGLE3 等算法的测试。
原始 PR · 作者 sglang-bot · 合并时间 2026-06-18 07:13
sglang-kernel 版本号从 0.4.3 升至 0.4.4
该 PR 属于常规依赖更新,无需深入审查。建议合并前确认 CI 测试通过,确保新内核版本与当前代码兼容。
bench_serving 新增 --cache-report 展示缓存命中细分
该 PR 代码清晰、测试充分(通过现有 CI),适合合并。建议后续为该功能添加单元测试,确保 `_extract_cache_from_sglext` 在不同响应格式下的稳定性。审核时已注意兼容性,值得参考其安全处理 null 的方式。
回退 PR #23862 中 head_dim 赋值逻辑及对应测试
建议尽快合入以恢复 PR #23862 之前的行为。合入后应监控 CI 中相关模型(尤其是 MLA 架构)的测试是否通过,并考虑是否需补回更稳健的测试。
修复 DeepSeek-OCR-2 bench_serving 处理器加载
该 PR 改动清晰、风险低,值得合并。但建议后续补充对应 DeepSeek-OCR-2 的 benchmark 测试用例,防止回归。团队可关注 `hf_transformers_utils.get_processor` 对更多模型的处理逻辑,避免类似问题。
参与讨论