SM120 禁用 cuBLASLt GELU 融合,RTX 5090 提速约 20.4%
值得精读。PR 虽小但展示了“按架构限制 kernel 选择 + 位精确回退优先”的决策模式,并有完整的精度与性能验证方法。对于维护 diffusion 内核选择逻辑或关注 SM120/Blackwell 性能的工程师,本 PR 的 guard 写法(`get_jit_cuda_arch` 判架构)可以直接复用。
SGLang is a high-performance serving framework for large language models and multimodal models.
SM120 禁用 cuBLASLt GELU 融合,RTX 5090 提速约 20.4%
值得精读。PR 虽小但展示了“按架构限制 kernel 选择 + 位精确回退优先”的决策模式,并有完整的精度与性能验证方法。对于维护 diffusion 内核选择逻辑或关注 SM120/Blackwell 性能的工程师,本 PR 的 guard 写法(`get_jit_cuda_arch` 判架构)可以直接复用。
--cpu-offload-components 支持 model_index 动态键与 all/none
值得精读。核心设计是三层:normalize_cpu_offload_components 做输入规范化、ServerArgs.should_cpu_offload_component 做统一决策、component_manager 的 _should_keep_single_dit 让性能快路径服从内存策略。建议重点对照 server_args.py 的 _adjust_cpu_offload_components 与 component_manager.py 的 finish_request 逻辑;如果团队在持续扩展新 diffusion 模型,这套“动态组件键 + 统一装载判定”模式可直接复用;若只维护现有模型,需关注 MPS 与 legacy flag 混用边界。
DSV4 流式推理与工具调用解析改为 chunk 无关
值得精读。核心看点是 holdback 设计(最长前缀匹配 + finish 冲刷)与 TestStreamingChunkSizeInvariance 的多 chunk size 不变量测试,这两种手法对任何做增量解析的流式系统都有借鉴意义;同时建议关注 PR body 中显式固定的两个已知分歧,后续涉及 DeepSeek-V4 解析的改动必须同步更新对应测试。
更新 Cosmos3 Edge 与蒸馏版 cookbook 文档
值得快速浏览:若团队正在部署或计划接入 Cosmos3 Edge / 蒸馏版检查点,本文档是权威配置参考。技术深度较低(纯文档),但"配置驱动变体识别"与"蒸馏版固定 sigma 调度"两个设计语义值得留意,后续排查用户误配时可快速定位到文档对应小节。
增强位精确融合回退诊断并新增 FlashInfer 提示
值得精读,尤其是维护 diffusion 融合 kernel 或位精确验证机制的工程师。重点关注三点设计:一是用“回调传入 + 函数内延迟导入”实现零稳态开销的诊断;二是用多层 try/except 保证诊断永远不破坏正确性回退;三是用 `importlib.metadata` 对多个关联包版本做 best-effort 探测。对依赖日志解析与告警的团队,建议同步检查 warning 文案变化是否需要适配。
调优 SM120 Diffusion 内核启动,RTX 5090 提速约 10.9%
建议内核调优和 Diffusion 性能相关工程师快速阅读。值得借鉴的是:用寄存器数/占用率分析定位瓶颈、用穷举行与 warp 扫描确定架构特定配置,并刻意保持 SM90 启动字节级不变以控制回归风险。该 PR 本身不涉及架构级设计,无需精读。
原始 PR · 作者 nv-dmajchrowski · 合并时间 2026-08-12 10:29
Cosmos3 Edge 与蒸馏变体支持,变体自动识别
值得精读。重点看三处设计:① 变体检测一次性预计算(`update_config_from_dict` + `lru_cache`)避免 per-request 下载 checkpoint 配置,这是 diffusion 多变体服务的通用模式;② Ulysses SP 下 SDE 噪声生成器跨 rank 同步的思路,可复用到其它扩散模型;③ `_predict_noise_cfg` 对 CFG padding 在无 mask cross-attention 下语义的分析(零 K/V 仍占 softmax 权重),是少见的数值质量权衡。另外 review 中 mickqian 对防御性代码的两次拒绝(fail-fast、显式契约)展示了该仓库的工程偏好,值得团队对齐。
修复 diffusion 基准误传弃用 --warmup 标志
值得快速浏览,尤其是 CI 配置维护者。关键设计决策是用 `--warmup-mode server` 替代而不是删除标志,避免静默关闭预热;作者提出的 pre-merge 参数预检 lint 是低成本的后续改进,建议纳入 CI 治理。
参与讨论