K3 接受长度阈值改为 GSM8K 平均,放宽单提示阈值
该 PR 值得精读,尤其是对负责 CI 测试阈值设计和维护的工程师。它展示了如何识别并修复由单样本方差导致的测试不稳定,以及如何将阈值建立在更稳定的统计量(GSM8K 平均)上。关键设计决策包括:区分“稳态吞吐”与“端到端速度”、避免让正确性修复被不相关指标绑架、以及用历史数据支撑安全边际。
SGLang is a high-performance serving framework for large language models and multimodal models.
K3 接受长度阈值改为 GSM8K 平均,放宽单提示阈值
该 PR 值得精读,尤其是对负责 CI 测试阈值设计和维护的工程师。它展示了如何识别并修复由单样本方差导致的测试不稳定,以及如何将阈值建立在更稳定的统计量(GSM8K 平均)上。关键设计决策包括:区分“稳态吞吐”与“端到端速度”、避免让正确性修复被不相关指标绑架、以及用历史数据支撑安全边际。
rust 前端 parity 测试固定 eager prefill,修复 CI 偶发失败
值得快速阅读。虽然改动只有 8 行,但 PR body 对根因的推导过程质量很高:通过对比 #33352 自身 CI 与计划任务运行的两端 `#running-req` 状态,用表格证明了失败是时序依赖而非确定性 bug。它展示了 CI 稳定性维护中一个关键原则:bit-identical 类断言必须控制所有影响数值的变量,测试只应覆盖自己声称覆盖的东西。
刷新 diffusion 技能文档与基准脚本,对齐最新运行时
该 PR 值得快速浏览,重点看 `bench_diffusion_denoise.py` 两处逻辑变更和 `existing-fast-paths.md` 的 fast-path 清单——它们直接反映了近期 diffusion 内核优化(FLUX/GLM/SANA LayerNorm+modulate、Wan causal VAE 等)的落地状态。若你负责 diffusion 性能分析或维护 agent 技能,建议以此 PR 为基线核对本地技能版本;若只是普通用户,了解 `SGLANG_DIFFUSION_SYNC_STAGE_PROFILING` 的语义即可,不需要精读。
FLUX.1 融合 LN+modulate 内核上线 lossless,提速 1.2%
值得精读。它本身改动很小(只 rewire 一个文件),但集中体现了 sglang diffusion 侧的性能工程方法论:quality tier 与 bit-exact 语义如何协同、运行时自验证如何让内核接入保持安全、以及如何用 md5/PSNR 协议量化每一步优化。建议结合 #34004、#34008、#33819 串读,可以完整看到 FLUX.1 优化从 plumbing 到 kernel 再到 wiring 的演进。
Wan VAE 解码器融合数据搬运内核,lossless 解码提速 17%
值得精读。本 PR 是 kernel-level 数据搬运消除的典范:以 strict bit-exact(非近似)为约束,用融合内核替代多次全张量遍历,并以多层次验证(kernel 级 bitwise 单测 + 端到端 md5 + 与既有 quality gate 组合验证)支撑“纯数据搬运”论点。值得关注的设计决策包括:紧凑缓存与 conv 输入同一 pass 双输出(实现缓存簿记完全消除)、输出布局严格跟随 aten(保护下游 layout-sensitive 逻辑)、完备的 fallback 条件与可交错性。对 diffusion/视频推理、Triton 内核开发、性能工程团队均有参考价值。
修复 diffusion 阶段计时未同步 GPU 队列导致的 2-3 倍虚高
值得关注 diffusion 性能分析和 GPU 异步计时工具的同学精读:修复虽小,但 `_maybe_sync_device()` 在计时起点与终点双向同步的语义清晰解决了异步队列归属问题,新增测试也精巧复现了队列尾部泄漏场景。对普通 SGLANG 用户无需跟进。可留意此修复落地后,依赖 stage 计时做消融对比的 diffusion 优化 PR(如 #34126、#34015)读数会更容易解释。
原始 PR · 作者 yuankaichen-amd · 合并时间 2026-08-09 06:44
一行修复 mori 后端下 Qwen3-MoE 双重归约导致的垃圾输出
值得精读的关键点不在于这一行,而在于后端门控模式的演进:新增后端时需要在所有 MoE 模型的 forward 分支中同步补全枚举判断。建议后续补充一个针对 mori 后端的回归测试,或将后端能力判断从各模型手写条件收敛为统一封装,避免再次遗漏。
DeepSeek V4 DSpark 支持 AMD HIP,打通 unified KV ring 注入
值得精读。核心看点:`_unified_inject_loc` 的 ring 寻址与双重 skip 设计、HIP 后端 ragged verify 图 key 改造(token-tier graph key)、以及围绕 nightly-only 覆盖缺口的 CI 流程讨论。若要在 AMD 上部署 DSV4 DSpark,需同时跟进 #34147 保证夜间覆盖,并在后续改动中保持 `target_verify_num_draft_tokens` 与 server args 的 gamma 约定一致。
参与讨论