移除 PCG 下 seq_lens_cpu 强制发布
此 PR 值得精读,尤其对于关注 CUDA graph 和异步推流的开发者。它展示了从保守守卫到精准声明的演进,以及如何处理不同场景(ngram)的特例。设计决策(所有消费者在 GPU-only 路径下对 None 安全)值得学习。建议验证目标配置(如 DeepSeek MoE 模型 + PCG)的实际性能提升。
SGLang is a high-performance serving framework for large language models and multimodal models.
移除 PCG 下 seq_lens_cpu 强制发布
此 PR 值得精读,尤其对于关注 CUDA graph 和异步推流的开发者。它展示了从保守守卫到精准声明的演进,以及如何处理不同场景(ngram)的特例。设计决策(所有消费者在 GPU-only 路径下对 None 安全)值得学习。建议验证目标配置(如 DeepSeek MoE 模型 + PCG)的实际性能提升。
将 bench_one_batch_server 搬迁到 sglang/benchmark/ 并添加 shim
建议简要阅读以了解 SGLang 项目中的 benchmark 代码组织方式及向后兼容 shim 的实践。Gemini 代码审查中提出的稳健性改进值得参考。
升级 GitHub Actions 中 github-script 到 v8
建议合并。低风险维护型 PR,属于依赖升级的最佳实践,有助于保持 CI 基础设施的健壮性。
修复 eager runner 静态缓冲区尺寸不足问题
建议阅读。虽然改动较小,但修复了两个不易察觉的边界条件 bug,体现了作者对调度器逻辑的深入理解。`max_prefill_buffer_tokens()` 的设计可作为后续类似缓冲区尺寸计算的模式参考,值得精读以理解 PP dynamic chunking 和 MLP sync 的交互细节。
复用静态缓冲区替代逐次分配,优化 dummy run 内存管理
该 PR 值得精读,尤其是 `_dummy_run` 的缓冲区接管模式和 `_autotune_buffers` 的适配器设计。review 中提出的问题值得在后续 PR 中跟进修复。建议关注其与 #28387 等 runner 重构 PR 的关联,形成对 SRT 运行器架构演进的全局理解。
统一 kernel warmup 至 BaseRunner 生命周期
精读并理解 warmup 统一的设计;部署前优先修复 pp_proxy_topk_size 缺失问题。
将 EagerRunner 提取为独立类,实现多态分发
建议精读。本 PR 是 runner 层系统重构的重要一步,展示了如何通过多态分发分离执行路径,并统一缓冲管理。自动化审查指出的潜在问题值得在合并前仔细验证,尤其是共享缓冲池的副作用和缓冲区大小估算。建议关注后续的修复 PR(可能基于这些评论)。
原始 PR · 作者 alisonshao · 合并时间 2026-06-20 03:24
将GB300夜间测试接入标准Nvidia工作流
建议批准该PR,但需注意: 1. 首次合并后手动触发`nightly-test-perf-4-gpu-gb300`作业验证全流程。 2. 关注测试timeout风险,若常超时增加timeout-minutes或拆分测试。 3. 审查测试参数调整的准确性(尤其是baseline accuracy改动)。 值得学习的设计点:针对特定硬件的测试策略从全量回归聚焦到最优量化模式(NVFP4),可推广到其他硬件平台。
参与讨论