LTX-2 AdaLN 九输出合并为单 slab 分配,提速 1.63x
值得快速阅读。核心价值不在改动规模,而在“多输出 Triton kernel 用单 slab + `unbind` 视图减少 allocator 往返”这一通用优化模式,以及用 `torch.compile(fullgraph=True)` 做回归保护的测试思路。生产路径上如存在同类多输出内核,可直接套用该模式。
SGLang is a high-performance serving framework for large language models and multimodal models.
LTX-2 AdaLN 九输出合并为单 slab 分配,提速 1.63x
值得快速阅读。核心价值不在改动规模,而在“多输出 Triton kernel 用单 slab + `unbind` 视图减少 allocator 往返”这一通用优化模式,以及用 `torch.compile(fullgraph=True)` 做回归保护的测试思路。生产路径上如存在同类多输出内核,可直接套用该模式。
SM103 调优 QK RMSNorm 启动,B300 提速 1.72x
值得快速阅读的低风险性能优化样本。核心价值不在改动本身,而在于其方法论:先用 Nsight Compute 定位 launch-bound,再用穷举 sweep 选定 row/warp 组合,最后以 bit-exact 与 torch.equal 作为验收闸门降低验证成本。对于计划做多架构内核调优的工程师,建议关注 get_jit_cuda_arch() 的跨平台行为,并考虑将此类按 SM 分流的 launch 配置抽象成统一配置表,避免每个内核各自 if-else。
修复 FP8 反量化缓存与 torch.compile 不兼容
值得精读。改动虽小,但展示了一个典型的 PyTorch 机制坑位——`inference_mode` 产物会丢失版本计数器,进而影响 `torch.compile` 的 guard 建立;其修复方式(局部退出 inference_mode + no_grad)和回归测试写法(先 promotion 再 fullgraph 编译并对比 bit-exact)都值得在后续缓存类功能中复用。
SM103 启用精确 QKNorm+RoPE 舍入修复
值得快速浏览(约 10 分钟)。这是 #34347 的后续补丁,展示了跨 GPU 架构维护 bit-exact 数值语义的典型做法:用条件编译精确枚举受影响架构,而不是对所有架构开启精确路径。若要深入学习,可结合 `test_qknorm_rope_preserves_split_bf16_rounding` 理解 split 参考与融合实现的舍入差异。
SM103 调优 QK head LayerNorm 启动,B300 提速 1.46x
值得快速阅读。适合关注 diffusion 内核优化或 CUDA 架构差异的工程师,尤其可以学习“按架构分派 launch 配置”这一低成本高性能调优模式;对不涉及该内核的读者价值有限。
修复 ReqTimeStats 0.0 哨兵误 rebase
值得精读:PR 很小但问题层次深,一行条件判断暴露了“哨兵值穿越 IPC 被时钟 rebase 污染”的观测链路反模式。重点关注:① `__setstate__` 中 falsy 跳过策略与 `convert_time_cross_thread` 的配合;② 两 hop 测试如何用 mock 锚点精确复现跨进程时钟差,可作为 metrics 类 bug 回归测试的模板。
原始 PR · 作者 XinyuJiangCMU · 合并时间 2026-08-12 14:27
AMD miles 夜间镜像新增无日期标签发布
该 PR 为低优先级的 CI 发布流程微调,不建议精读。值得留意的设计点:直接 push 本地已有的标签,优于在 registry 里用 `imagetools create` 生成元数据引用;对单平台镜像,`imagetools create` 的 `--prefer-index=true` 默认行为可能产生不必要的 image index 层级,发布场景应显式比较两种方式的结果。
修复 DFlash 滑动注意力因果默认值回归
值得精读。这是一个小而完整的回归修复,展示了『显式声明优先 + 历史默认值分层回退』的设计模式,并附带清晰的 CI 验证数据。对维护 DFlash 推测解码、draft 模型接入或类似『配置默认值契约』的同学有参考价值。重点看 `_get_dflash_attention_type` 的默认值传递与 `MuseGlimmerAssistantConfig.is_causal` 的配套声明。
参与讨论