新增 KL 一致性测试技能文档,沉淀调试与阈值方法论
建议负责确定性推理、logprob 一致性测试与相关 CI 的工程师精读,重点是两个独立条件的区分与 MoE 放大效应部分;对一般读者可略过。该文档是团队调试经验的优质沉淀,值得保留,并建议在 `kl_test_utils` 或确定性推理代码变动时同步更新。
SGLang is a high-performance serving framework for large language models and multimodal models.
新增 KL 一致性测试技能文档,沉淀调试与阈值方法论
建议负责确定性推理、logprob 一致性测试与相关 CI 的工程师精读,重点是两个独立条件的区分与 MoE 放大效应部分;对一般读者可略过。该文档是团队调试经验的优质沉淀,值得保留,并建议在 `kl_test_utils` 或确定性推理代码变动时同步更新。
修复 DP-Attention 下投机解码空闲批次崩溃
值得快速阅读:6 行修复展示了 SGLang 中 forward_mode.is_idle() 作为空批次守卫的惯用模式,对理解 DP attention 下 idle rank 的调度语义有帮助。若要吸收经验,建议一并关注未来是否有配套回归测试(如 specdec + DP 组合的用例),以及 init_forward_metadata 对空 seq_lens 的防御是否应下沉到 backend 层统一处理。
修复 MLX 单测 mock 缺 mamba 字段导致的 CI 失败
作为测试修复,本 PR 适合快速浏览,不值得精读。值得关注的点是:生产代码新增字段时,测试 mock 需要同步维护;可结合 #33477 的 Mamba mask 复用逻辑理解该字段的来源。
新增 Inkling-Small 确定性 logprob 一致性测试
值得精读。该 PR 展示了如何利用确定性推理将 KL 测试从统计容差变为精确断言(阈值 1e-9),并覆盖普通、prefill cache-hit、decode cache-hit 三种关键路径,设计思路对状态复用类 bug 的防护很有借鉴意义。关注点:`_run` 封装与三个 helper 的阈值传递方式、cache-hit 变体对滑动窗口交接的覆盖、以及 GSM8K 阈值放宽与 CI 耗时的权衡。
修复确定性 gumbel 采样 u=1 端点,杜绝采样被屏蔽 token
值得精读。核心是一行 clamp 变更,但其数学论证(哈希网格间距、半开区间端点、bit-identical 保证)可以作为数值稳定性修复的范例;测试用例通过预计算 (seed, position, column) 精确命中 0xFFFFFFFF 端点,避免了概率性测试的不稳定。关注点:multinomial_with_seed 的共享语义、clamp 上限与 float64 精度的关系,以及后续是否把同样端点保护迁移到其他哈希采样实现(如 EAGLE 专用采样)。
修复投机解码下 sconv 状态内存破坏,缓存复用后位级一致
值得精读。核心亮点是 CUDA Graph 捕获与 Python 控制流 specialize 的交互处理:捕获时若 `if` 分支跳过 kernel,该 kernel 永远不会出现在图中,本 PR 用“全零惰性字段 + 强制在图上保留 scatter”的方法解决,是通用且可迁移的设计。另一个值得借鉴的点是把静态缓冲 padding 清零作为 `populate_from_forward_batch` 的数据契约写入,从源头保证图回放位级可复现。建议后续补充回归测试,让这类修复可被 CI 捕获。
原始 PR · 作者 DevashishLal-CB · 合并时间 2026-08-09 20:15
新增 flashinfer RMSNorm+FP8 量化融合,支持 SM90/100/120
值得精读 PR,尤其关注 `layernorm.py` 中如何用特征探测安全地启用融合路径、`fp8_utils.py` 如何通过 `pre_quant_output_dtype` 保持 dtype 契约。该模式可作为后续 kernel fusion 接入的参考模板。注意目前仅 LLaMA / Qwen2 两个模型接入,若有相关模型需求可参照推进。
原始 PR · 作者 zyzshishui · 合并时间 2026-08-09 20:05
修复 GLM4.7-Flash 在 FA4 后端下 MLA head 比例不兼容问题
值得精读。该 PR 展示了如何在不改内核的前提下,通过包装器层做 head 比例 padding 来适配固定 tile 尺寸的 MLA 内核,设计简洁且伴随充分回归测试。关注点:`_pad_mla_q_heads` 中 2 的幂取整策略、`_unpad_mla_result` 对 LSE 的同步裁剪、以及强制 `num_splits=1` 的语义影响。建议后续跟踪 flash-attn 上游 PR 2670 合并后移除 hd256 workaround,并持续收集 FA4 在真实负载下的性能数据。
参与讨论