支持非门控MoE在线MXFP8量化并默认使用CUTLASS后端
建议核心推理引擎开发者精读`fp8_utils.py`中`initialize_fp8_gemm_config`的自动后端选择逻辑,理解如何根据硬件和量化类型动态切换GEMM后端。对于MoE模型开发者,`flashinfer_trtllm.py`中非门控权重的对齐处理是一个值得参考的设计模式。后续关注点:需要为非门控MoE添加专用测试,以及考虑在更多硬件上验证CUTLASS后端的性能。
SGLang is a high-performance serving framework for large language models and multimodal models.
支持非门控MoE在线MXFP8量化并默认使用CUTLASS后端
建议核心推理引擎开发者精读`fp8_utils.py`中`initialize_fp8_gemm_config`的自动后端选择逻辑,理解如何根据硬件和量化类型动态切换GEMM后端。对于MoE模型开发者,`flashinfer_trtllm.py`中非门控权重的对齐处理是一个值得参考的设计模式。后续关注点:需要为非门控MoE添加专用测试,以及考虑在更多硬件上验证CUTLASS后端的性能。
修复 draft 模型污染 target 路由专家捕获
对于涉及 speculative decoding 或 MoE draft 模型的开发者,建议仔细阅读此 PR 的设计:如何通过配置标志实现跨后端的统一捕获门控,以及在初始化早期阻断副作用的时机选择。对于使用者,应升级以修复相关 bug。建议未来补充自动化测试以确保回归覆盖。
原始 PR · 作者 merrymercy · 合并时间 2026-06-25 06:50
添加调度器指标扩展钩子,支持模型特定 SoL 统计
该 PR 值得精读,它展示了如何通过钩子模式为内部系统添加可扩展性,同时注意保留必要数据供异步处理器使用。关注点在 `MetricsReporter` 中的覆写方法和 `ScheduleBatch.copy` 的数据保留策略。
原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-06-25 06:45
简化 TRTLLM MLA draft extend 的 CUDA graph metadata 填充
可合并。变更简洁,经过 reviewer 确认,逻辑正确。建议后续关注是否有类似冗余字段存在于其他 backend,可做统一清理。
统一 FutureMap.stash 为 RelayPayload 数据类
值得精读,因为引入了统一数据类设计,消除了类型分支,是清理调度层技术债务的典范。同时展示了如何处理 ngram 等特殊路径。关注点是测试覆盖尚缺,未来合并类似重构时应同步新增测试。
无条件 relay bonus_tokens,删除废弃标志
该 PR 是紧随 #29118 的清理步骤,值得快速合并以保持代码整洁。但建议在合并 #29118 之后验证确认没有回归。
将 DFlash verified_id 合并到 shared bonus_tokens relay
本 PR 是纯粹的重构,没有新功能,但体现了如何消除跨算法模块的重复通道。建议团队在引入新的推测解码算法时参考这种统一 relay 的设计思路。值得精读的要点是 `overlap_utils.py` 中移除 `verified_id_buf` 的高效方式,以及如何通过单一 `bonus_tokens` 字段同时支持 EAGLE 和 DFlash。
修复 FlashInfer bmm_fp8 后端选择错误
建议合入,这是一次经过调研的低风险性能修复,改动极小,收益明确。无需深入精读,但值得关注后续是否有更多 backend 硬编码调整。
参与讨论