Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-04 00:39 同步状态:空闲 下次计划:2026-09-04 01:39

PR 列表

更多筛选
2026-06-18
重构 重要性 5.25 洞察度 3.00

统一 bench seed 默认值并重命名 profile 参数

本 PR 为低风险的机械性清理,可直接通过。若团队有依赖默认 seed=1 的自动化基准测试,需注意结果可能微变,但通常 42 更规范。建议在后续 PR 中进一步统一其他参数名称(如 `result-filename` 等)。

#27471 add dflash gemma4 support

原始 PR · 作者 dcw02 · 合并时间 2026-06-18 07:39

功能 重要性 7.94 洞察度 5.00

为Gemma4添加DFlash推测解码支持

值得精读该 PR,尤其是 dflash_worker_v2.py 中的采样逻辑改动:如何优雅地处理不同类型 LM head(有/无 shard_indices),以及测试脚本如何通过 `/server_info` 校验 spec 配置和 acceptance length。建议后续类似功能的实现可以遵循这种模式。

性能优化 重要性 8.49 洞察度 6.00

trtllm_mha 后端移除 CPU seq_lens 同步,提升推测解码性能

**值得精读**:该 PR 清晰地展示了一个通过设备端计算替代主机端同步的经典优化案例。设计决策(静态上界、设备端保护、Python 包装器)和 review 中的讨论(eager 路径同步移除)都很有参考价值。对于理解 SGLang 注意力后端的同步模型和推测解码优化很有帮助。

缺陷修复 重要性 7.42 洞察度 6.00

修复 Spec V2 下 return_hidden_states 截断问题

PR 值得精读,尤其是对理解 speculative decoding 中张量布局和步幅切片的开发者。设计决策(如使用 num_correct_drafts_per_req_cpu + 1 作为接受长度、在 output_streamer 中二次截断)体现了对流水线中不同阶段语义的把握。建议合并后补充覆盖 EAGLE3 等算法的测试。

#28572 chore: bump sglang-kernel version to 0.4.4

原始 PR · 作者 sglang-bot · 合并时间 2026-06-18 07:13

基础设施 重要性 4.05 洞察度 2.00

sglang-kernel 版本号从 0.4.3 升至 0.4.4

该 PR 属于常规依赖更新,无需深入审查。建议合并前确认 CI 测试通过,确保新内核版本与当前代码兼容。

功能 重要性 7.16 洞察度 3.00

bench_serving 新增 --cache-report 展示缓存命中细分

该 PR 代码清晰、测试充分(通过现有 CI),适合合并。建议后续为该功能添加单元测试,确保 `_extract_cache_from_sglext` 在不同响应格式下的稳定性。审核时已注意兼容性,值得参考其安全处理 null 的方式。

#28571 revert the head_dim assignment from PR 23862

原始 PR · 作者 cctry · 合并时间 2026-06-18 06:46

缺陷修复 重要性 7.61 洞察度 4.00

回退 PR #23862 中 head_dim 赋值逻辑及对应测试

建议尽快合入以恢复 PR #23862 之前的行为。合入后应监控 CI 中相关模型(尤其是 MLA 架构)的测试是否通过,并考虑是否需补回更稳健的测试。

缺陷修复 重要性 5.63 洞察度 3.00

修复 DeepSeek-OCR-2 bench_serving 处理器加载

该 PR 改动清晰、风险低,值得合并。但建议后续补充对应 DeepSeek-OCR-2 的 benchmark 测试用例,防止回归。团队可关注 `hf_transformers_utils.get_processor` 对更多模型的处理逻辑,避免类似问题。

参与讨论