消除 extend_input_len 的双重语义
目标明确、改动精致、影响可控。建议精读 `schedule_policy.py` 中 `add_dllm_staging_req` 和 `add_chunked_req` 的即时计算模式,作为消除隐式状态的好范例。关注其堆叠的 `#27610` 后续 PR。
SGLang is a high-performance serving framework for large language models and multimodal models.
消除 extend_input_len 的双重语义
目标明确、改动精致、影响可控。建议精读 `schedule_policy.py` 中 `add_dllm_staging_req` 和 `add_chunked_req` 的即时计算模式,作为消除隐式状态的好范例。关注其堆叠的 `#27610` 后续 PR。
单节点 SM10X 默认使用 MNNVL 后端
该 PR 为小范围性能优化,逻辑简单,对于 Blackwell 用户可快速跟进。值得关注的是,团队依据真实 profiling 数据(CUPTI)做出默认值调整,这是值得学习的性能调优实践。
支持非门控MoE在线MXFP8量化并默认使用CUTLASS后端
建议核心推理引擎开发者精读`fp8_utils.py`中`initialize_fp8_gemm_config`的自动后端选择逻辑,理解如何根据硬件和量化类型动态切换GEMM后端。对于MoE模型开发者,`flashinfer_trtllm.py`中非门控权重的对齐处理是一个值得参考的设计模式。后续关注点:需要为非门控MoE添加专用测试,以及考虑在更多硬件上验证CUTLASS后端的性能。
修复 draft 模型污染 target 路由专家捕获
对于涉及 speculative decoding 或 MoE draft 模型的开发者,建议仔细阅读此 PR 的设计:如何通过配置标志实现跨后端的统一捕获门控,以及在初始化早期阻断副作用的时机选择。对于使用者,应升级以修复相关 bug。建议未来补充自动化测试以确保回归覆盖。
原始 PR · 作者 merrymercy · 合并时间 2026-06-25 06:50
添加调度器指标扩展钩子,支持模型特定 SoL 统计
该 PR 值得精读,它展示了如何通过钩子模式为内部系统添加可扩展性,同时注意保留必要数据供异步处理器使用。关注点在 `MetricsReporter` 中的覆写方法和 `ScheduleBatch.copy` 的数据保留策略。
原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-06-25 06:45
简化 TRTLLM MLA draft extend 的 CUDA graph metadata 填充
可合并。变更简洁,经过 reviewer 确认,逻辑正确。建议后续关注是否有类似冗余字段存在于其他 backend,可做统一清理。
统一 FutureMap.stash 为 RelayPayload 数据类
值得精读,因为引入了统一数据类设计,消除了类型分支,是清理调度层技术债务的典范。同时展示了如何处理 ngram 等特殊路径。关注点是测试覆盖尚缺,未来合并类似重构时应同步新增测试。
无条件 relay bonus_tokens,删除废弃标志
该 PR 是紧随 #29118 的清理步骤,值得快速合并以保持代码整洁。但建议在合并 #29118 之后验证确认没有回归。
参与讨论