Nemotron 3.5 Lightning cookbook 新增 BF16 配方
建议按需阅读:如果你在维护 cookbook snippet 或需要为其他模型扩展量化档位,本 PR 是一个很好的模板——展示了 `quantizations` + `modelNames`(`variant|quant` 键)与 `match` 三维矩阵(硬件 x 量化 x 策略)的组织方式,以及 MTP 复用 EAGLE 路径、草稿模型独立于目标量化档位的约定。对一般读者价值有限,不值得深入精读。
SGLang is a high-performance serving framework for large language models and multimodal models.
Nemotron 3.5 Lightning cookbook 新增 BF16 配方
建议按需阅读:如果你在维护 cookbook snippet 或需要为其他模型扩展量化档位,本 PR 是一个很好的模板——展示了 `quantizations` + `modelNames`(`variant|quant` 键)与 `match` 三维矩阵(硬件 x 量化 x 策略)的组织方式,以及 MTP 复用 EAGLE 路径、草稿模型独立于目标量化档位的约定。对一般读者价值有限,不值得深入精读。
Qwen3.8 cookbook:7 平台 18 配方部署指南
值得精读。重点看两处设计:一是 `qwen3.8.jsx` 中 DSpark 选项的 `disable` 条件与 `_handle_dspark`(`python/sglang/srt/arg_groups/speculative_hook.py`)硬约束的一一对应,这是『文档约束与运行时代码同源』的好范例;二是 `_playground.jsx` 中 `modeMeta` 的『先剥离同名 flag 头再追加』配合 `applyAllDeltas` 每次 render 重新 seed 的幂等机制,值得在同类配置生成引擎中复用。若后续要跟进,可为 `_playground.jsx` 补一个针对 PD 角色 flag 合并的单元测试,并关注 GB300 配方上游 flag 落地后移除标注。
Kimi-K3 全量支持 Ascend NPU,含 DSPARK 与 W4A8 量化
值得精读。核心看点:① kernel_dispatcher.extend_kernel 注入模式,让共享 KDA 后端零改动接入 Ascend 算子;② 数值等价 fallback 的工程化(显式开关 + unfused 路径,而非硬编码 if False);③ ModelSlim 前缀解析把 checkpoint 层级差异收敛在量化边界;④ DSPARK 图折叠与 eager 采样的精度权衡。若要在此基础上维护 NPU 路径,建议优先补自动化回归测试并把硬编码常量配置化。
流式分块转换并并行保存多路视频输出,显存降约 95%、耗时减半
值得精读,尤其是 `_try_save_cuda_videos_direct` 的显存/CPU 预算启发式和 `_sendfile_all` 的部分写处理,是典型的「零拷贝流式 + 资源感知并行」设计。建议关注两点:共享 memfd 缓冲在并行线程间的互斥窗口是否覆盖整个使用周期,以及非 Linux 平台回退路径的 CI 覆盖。若后续推广到更多 diffusion 模型,可考虑把 chunk 预算做成可配置项。
H3 参考视频按主机单次解码并共享映射,存储降 87.5%
值得精读。重点关注 `_decode_reference_video_shared` 中“两轮 collective 保证决策一致”的设计:第一轮广播 decode 状态与失败,第二轮广播 mapping 状态与失败,任何异常都整体回退而不是让某个 rank 单独失败;这是多 rank 共享内存类优化中容易踩坑的地方。其次关注 text/visual 两个 stage 对 `MINIMAX_H3_PREPARED_REFERENCE_VIDEO_EXTRA_KEY` 生命周期的 finally 清理,以及 `_MINIMAX_H3_SINGLE_RANK_TEXT_ENCODE_EXTRA_KEY` 在 DP 广播路径上禁用共享的细节。
新增 GLM-5.2 MXFP4 wide-EP16 2P1D 夜间测试配方
值得快速浏览,作为了解 SGLang 在 AMD 上 wide-EP 和 MTP 配置的参考。重点关注 `wide_ep` 参数、MoRI 环境变量和 MTP 配置块。注意检查模型路径一致性。
原始 PR · 作者 ajith-sirra-amd · 合并时间 2026-08-12 18:39
GLM-5.2 cookbook 新增 AMD MI355X MXFP4 部署配方
值得浏览(不必精读):这是标准的 cookbook 配置扩展 PR,展示了 SGLang 文档配置系统(Mintlify snippets + JSX config)如何组织多硬件/多量化组合的部署矩阵,以及如何在未验证状态下通过 disable/enable 门控与 verified: false 标记管理文档诚实性。值得关注的设计决策:1) 用 `"hw|quant"` 复合键在 dockerImages 中做细粒度镜像覆盖;2) 用 `enable`/`enableReason` 门控只对特定 hw+quant 组合开放 MTP 选项;3) 对 gfx950 专属能力(MXFP4、MTP 3-1-4)的显式范围界定。后续可跟进其 TODO 中的准确率/速度数据是否在后续 PR 中补齐并翻转 verified 标记。
原始 PR · 作者 yctseng0211 · 合并时间 2026-08-12 18:31
AMD PR 门禁切换至 ROCm 7.2,7.0 降为每日影子
该 PR 值得精读,尤其是 CI 门禁迁移策略、shadow 套件设计、任务归类和超时调整的实践。关注点:1) 从 7.0 重新生成 7.2 工作流以减少漂移的做法值得借鉴;2) 通过拆分 PR(如 Triton 安装)解耦风险和依赖;3) 将慢速夜间任务纳入 PR 门禁但缩短超时并修复退出码掩盖问题。
参与讨论