修复预填充感知 SWA floor 跟踪逻辑
值得精读。该修改展示了在 chunked prefill 场景下如何正确设置 SWA eviction floor,对于理解 SGLang 的 SWA 缓存管理和调度逻辑有帮助。建议同步查看 PR #29186 了解完整背景。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复预填充感知 SWA floor 跟踪逻辑
值得精读。该修改展示了在 chunked prefill 场景下如何正确设置 SWA eviction floor,对于理解 SGLang 的 SWA 缓存管理和调度逻辑有帮助。建议同步查看 PR #29186 了解完整背景。
原始 PR · 作者 JustinTong0323 · 合并时间 2026-06-28 13:54
添加MiniMax-M3 K-only稀疏KV的PD-disaggregation传递
该PR设计紧凑,`force_flat`参数优雅地复用MLA布局,值得学习。建议在合并Split 2后尽快rebase并CI验证。对于关注disaggregation或稀疏KV的开发人员,值得精读。
原始 PR · 作者 merrymercy · 合并时间 2026-06-28 12:48
修复EAGLE draft hidden dim提取并集中规格函数
该PR值得精读,因为它展示了如何通过集中化辅助函数消除重复逻辑并修复隐蔽的维度错误。设计决策如使用config驱动而非模型层属性是更稳健的做法。此外,prefill CUDA graph runner中`input_embeds` slot的注册注释清晰地解释了multimodal路径的需求。建议团队后续补充相关测试。
原始 PR · 作者 merrymercy · 合并时间 2026-06-28 12:36
修复 DP-attention 下 SHM 内存的竞态条件
该 PR 修复了一个明确的并发竞态条件,逻辑清晰,改动量小,可以审阅后合并。值得关注的是其对 DP-attention 路径的同步策略:使用 attn_tp 和 attn_cp 分组 barrier 而非全 tp 组 barrier,避免了不必要的同步开销,是一个好的设计选择。
修正GB300 FP4 nightly测试内存比例
简单修复,无需深入阅读。但可留意是否后续需要为不同变体动态调整内存比例,避免硬编码。
修复 --warmup 静默降级为 request 模式
值得合并。这是一个典型的“配置继承边界”bug:`default_args` 未记录为 explicit 导致注入的默认值与显式标志交互异常。PR 分析透彻、修复精准、单测完备,且 H100 实测数据验证有效。值得其他 CLI 参数解析模块参考此模式(default_args 与 explicit 标志的一致性)。
原始 PR · 作者 merrymercy · 合并时间 2026-06-28 11:37
修复 SWA cache loc 切片未统一应用的问题
值得精读。该 PR 展示了如何用一个集中的 `__post_init__` 钩子解决跨后端的共性问题,是设计模式的应用范例。建议关注 `KVWriteLoc` 数据类的设计思想,以及如何避免在多个后端重复修复。
将draft贪婪采样并入CUDA graph,提升fwd_occupancy
值得精读,尤其关注 `_DflashDraftSampler` 的 capture-safe 设计以及 `_maybe_build_draft_sampler` 中的条件检查。该 PR 展示了如何在不破坏兼容性的前提下将 eager 操作融入 CUDA graph,是 CUDA graph 优化调用的良好范例。
参与讨论