重命名测试变量 tree → cache,为拆分准备
该 PR 是典型的重构准备提交,适合快速合入。代码审查时可重点关注重命名是否一致,特别是 TreeCore 相关变量是否正确保留了 'tree_core' 子串。
SGLang is a high-performance serving framework for large language models and multimodal models.
重命名测试变量 tree → cache,为拆分准备
该 PR 是典型的重构准备提交,适合快速合入。代码审查时可重点关注重命名是否一致,特别是 TreeCore 相关变量是否正确保留了 'tree_core' 子串。
更新 NPU 文档中 --use-ray 参数支持状态
可快速合并。建议同步检查文档中其他参数的支持描述是否准确,避免类似问题。
将 DSA top-k 种子锚定至 draft-extend 阶段以提升接受长度
值得精读,尤其关注 seed 传递在 eager、CUDA graph、overlap 三种路径下的处理方式。设计决策明确(使用门控开关确保兼容性),展示了如何通过调整缓存锚定点优化推测解码。对于从事推测解码或 MOE 模型性能优化的工程师有参考价值。
原始 PR · 作者 LarrySimingDeng · 合并时间 2026-07-07 11:32
为 MLX 后端 Qwen MoE 模型添加正确性测试
建议精读 `test_mlx_reference_correctness.py` 的设计:内存安全策略、模型释放顺序、batched 隔离性测试等思路值得其他后端参考。烟雾测试的框架简单可靠,适合作为更多 MLX 模型测试的起点。
原始 PR · 作者 LarrySimingDeng · 合并时间 2026-07-07 11:32
修正 MLX 量化模型 KV 池 dtype 为计算精度
建议合并。该 PR 修复了一个明确的正确性/性能 bug,测试覆盖充分,设计清晰(利用 scales 携带计算 dtype)。值得关注的设计决策是:通过 scales 推断 dtype 而非为每个量化格式适配,保持了通用性。
原始 PR · 作者 noob-se7en · 合并时间 2026-07-07 11:31
修正MLX后端单token分块预填充延续误路由为decode
建议阅读此PR,以理解状态驱动路由(check decoding_reqs)相比长度启发式的优势,以及通过抽取共享方法同步双路径的设计模式。对于参与MLX后端的开发者,合并后可消除隐式数据损坏风险。
为 bench_serving 新增 agentic-trace 多轮数据集加载
建议阅读 `AgenticTraceDataset` 的实现,这是为 `bench_serving` 添加新数据集的参考范例。重点关注 `from_args` 工厂方法和 `load` 方法中偏移量取模、最大轮数截断等逻辑。
支持 Blackwell CuTe DSL BF16 GEMM JIT 内核
建议重点阅读以下设计: - CuTe DSL warp 专业化模式(7 warp 分工)如何降低延迟。 - 静态战术表的设计流程:离线 autotune + Claude 启发式优化生成 29 种配置。 - 后端注册与配置下发模式(`server_args` -> `initialize_bf16_gemm_config` -> 运行时分发)。 此 PR 展示了完整的 JIT 内核集成范例,适合关注 Blackwell 优化的读者精读。
参与讨论