修复 Mooncake 后端未传输 DSv4 状态池的 Bug
值得精读,尤其是关注解耦推理、MLA 状态传输或 Mooncake 后端的开发者。设计决策(委托 `_send_kvcache_generic` 而非新建扁平路径)体现了对 MTP 场景兼容性的考量,值得学习。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 Mooncake 后端未传输 DSv4 状态池的 Bug
值得精读,尤其是关注解耦推理、MLA 状态传输或 Mooncake 后端的开发者。设计决策(委托 `_send_kvcache_generic` 而非新建扁平路径)体现了对 MTP 场景兼容性的考量,值得学习。
拆分推测解码V1 Draft/Extend数据结构
该 PR 值得精读,尤其是 `eagle_info.py` 与 `frozen_kv_mtp_info.py` 中的数据结构设计。对于从事推测解码开发的工程师,可以学习如何通过类型拆分消除阶段混淆。PR body 中的“Looks confusing but is correct”部分对设计权衡有清晰解释,可作为代码注释的典范。建议在合并前或合并后补充 V2 对齐的 issue 跟踪。
融合QKV RMSNorm并修复FP8 MoE权重加载
此PR包含两个值得关注的设计:融合Triton内核使用stride view避免拷贝,以及保守的fallback策略;加载器中的正则映射模式可复用于其他支持per-expert格式的模型。测试用例的三阶段设计(健康、非垃圾、精度)提供良好的回归保护。
原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-05-10 14:57
支持 Kimi-K2.5 EAGLE3 MLA 推测解码模型
值得精读 EAGLE3 与 MLA 结合的设计,特别是如何通过替换 `fused_qkv_a_proj_with_mqa` 来适配拼接输入。建议后续补充单元测试覆盖前向逻辑与权重加载。
原始 PR · 作者 alphabetc1 · 合并时间 2026-05-10 14:56
修复 Spec-V2 重叠调度中过时状态更新导致的 KV 记账错误
建议阅读核心逻辑变更和 review 讨论,理解异步过时状态处理的设计权衡;全局指标一致性问题可作后续优化方向。
修复 in-place pause 模式因缺少 empty_cache 导致的 OOM
该 PR 修复了一个明确的 OOM 问题,代码简洁,建议合入。讨论中关于跨平台兼容的取舍值得记录,未来如果有更多后端需求可考虑重构。
新增 cache-dit 的 1GPU 和 2GPU CI 测试用例
值得合并,建议后续缓存相关变更应确保该测试通过。可考虑进一步增加更多模型或配置的测试以覆盖更广场景。
增强请求转储的鲁棒性与可配置性
建议精读 `tokenizer_manager.py` 中的 `dump_requests`、`_dump_data_to_file` 和 `dump_requests_before_crash` 方法,理解 Pickle 回退的设计模式。值得关注的设计决策是:在出错时只丢弃 `server_args` 而非整体放弃,这是一种优雅的降级方案。
参与讨论