修复 SWA 缓存前缀恢复时的 admission livelock
该 PR 值得精读,因为揭示了一个精细的预算 double-count 问题,以及修复中如何平衡缓存前缀与 decode headroom。设计决策(capped at window)清晰且有测试佐证。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 SWA 缓存前缀恢复时的 admission livelock
该 PR 值得精读,因为揭示了一个精细的预算 double-count 问题,以及修复中如何平衡缓存前缀与 decode headroom。设计决策(capped at window)清晰且有测试佐证。
原始 PR · 作者 shanemort1982 · 合并时间 2026-07-25 20:20
DSPARK 推测解码支持语法约束与 tool_choice=auto
值得精读的 PR。它展示了如何在 speculative decoding 的 verify 阶段无缝集成 grammar mask,以及如何通过 step1 (显式 grammar) 和 step2 (隐式 tool_choice) 分步解决实际生产问题。特别关注 `fold_eligible` 与 CUDA graph 交互的设计决策,以及 `supports_grammar_overlap` 方法的多态扩展。
为KDA添加EAGLE推测解码target_verify支持
该PR值得精读,尤其是`_detect_conv_window_axis`的设计体现了同一代码库支持多种Conv Layout的策略。合并后可作为KDA推测解码的基础。建议同时阅读相关PR #30113和#28197了解完整上下文。
支持 HiCache 下 Mamba 分支的缓存命中
建议精读,尤其是 mamba_component.py 中 finalize_match_result 的 Mamba 分支点计算逻辑。该设计将 Full KV 命中长度与 Mamba 状态解耦,体现了良好的层次化缓存设计原则。
Marlin MoE kernel occupancy 调度与编译专门化优化
建议技术管理者将此 PR 作为 kernel 性能优化的典型案例阅读,重点关注 `determine_exec_config` 中 occupancy 计算逻辑以及 `if constexpr` 与 JIT 编译的结合方式。对 Marlin MoE 路径的其他量化变体(如 NVFP4)也可借鉴类似优化思路。
DFLASH 推测解码支持语法约束解码
值得精读。设计决策清晰:利用线性链退化树复用现有 EAGLE 机制,代码改动小但效果显著。同时暴露跨算法维护的挑战。
共享 spec worker 间的 grammar mask 构建与 verify-tree staging
建议仔细阅读 spec_utils.py 中新增的 GrammarTree 类和 build_grammar_vocab_mask 函数,尤其是在异步 GPU/CPU 交互场景下如何安全 staging 数据。该 PR 展示了将跨 worker 的通用模式提取为工具的最佳实践,值得在团队内推广。PR 讨论中关于设计窄接口的理由也值得学习。
消除 NGRAM 语法验证路径中 GPU 读回阻塞
该 PR 值得精读,尤其是 `_derive_tree_links` 的实现和如何通过调整执行顺序实现计算与通信重叠的思路。对于关注性能优化的工程师,这是一个极小改动带来显著收益的典范。
参与讨论