Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 03:32 同步状态:空闲 下次计划:2026-09-05 04:32

PR 列表

更多筛选
2026-06-25
功能 重要性 6.36 洞察度 5.00

支持非门控MoE在线MXFP8量化并默认使用CUTLASS后端

建议核心推理引擎开发者精读`fp8_utils.py`中`initialize_fp8_gemm_config`的自动后端选择逻辑,理解如何根据硬件和量化类型动态切换GEMM后端。对于MoE模型开发者,`flashinfer_trtllm.py`中非门控权重的对齐处理是一个值得参考的设计模式。后续关注点:需要为非门控MoE添加专用测试,以及考虑在更多硬件上验证CUTLASS后端的性能。

缺陷修复 重要性 6.99 洞察度 4.00

修复 draft 模型污染 target 路由专家捕获

对于涉及 speculative decoding 或 MoE draft 模型的开发者,建议仔细阅读此 PR 的设计:如何通过配置标志实现跨后端的统一捕获门控,以及在初始化早期阻断副作用的时机选择。对于使用者,应升级以修复相关 bug。建议未来补充自动化测试以确保回归覆盖。

#29207 Add scheduler metrics extension hooks

原始 PR · 作者 merrymercy · 合并时间 2026-06-25 06:50

功能 重要性 7.54 洞察度 5.00

添加调度器指标扩展钩子,支持模型特定 SoL 统计

该 PR 值得精读,它展示了如何通过钩子模式为内部系统添加可扩展性,同时注意保留必要数据供异步处理器使用。关注点在 `MetricsReporter` 中的覆写方法和 `ScheduleBatch.copy` 的数据保留策略。

重构 重要性 7.73 洞察度 5.00

统一 FutureMap.stash 为 RelayPayload 数据类

值得精读,因为引入了统一数据类设计,消除了类型分支,是清理调度层技术债务的典范。同时展示了如何处理 ngram 等特殊路径。关注点是测试覆盖尚缺,未来合并类似重构时应同步新增测试。

重构 重要性 5.67 洞察度 3.00

无条件 relay bonus_tokens,删除废弃标志

该 PR 是紧随 #29118 的清理步骤,值得快速合并以保持代码整洁。但建议在合并 #29118 之后验证确认没有回归。

重构 重要性 6.17 洞察度 4.00

将 DFlash verified_id 合并到 shared bonus_tokens relay

本 PR 是纯粹的重构,没有新功能,但体现了如何消除跨算法模块的重复通道。建议团队在引入新的推测解码算法时参考这种统一 relay 的设计思路。值得精读的要点是 `overlap_utils.py` 中移除 `verified_id_buf` 的高效方式,以及如何通过单一 `bonus_tokens` 字段同时支持 EAGLE 和 DFlash。

缺陷修复 重要性 4.53 洞察度 3.00

修复 FlashInfer bmm_fp8 后端选择错误

建议合入,这是一次经过调研的低风险性能修复,改动极小,收益明确。无需深入精读,但值得关注后续是否有更多 backend 硬编码调整。

参与讨论