#29768 [AMD] Stop rocm720 pr auto-runs
原始 PR · 作者 yctseng0211 · 合并时间 2026-06-30 23:58
停止 ROCm 7.2 PR 自动触发 CI
内容明确、改动单一,可直接合入。对关注 AMD CI 流程的人员有参考价值。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 yctseng0211 · 合并时间 2026-06-30 23:58
停止 ROCm 7.2 PR 自动触发 CI
内容明确、改动单一,可直接合入。对关注 AMD CI 流程的人员有参考价值。
原始 PR · 作者 yctseng0211 · 合并时间 2026-06-30 23:40
更新 AMD 本地 registry 地址并移除旧镜像作业
PR 变更简单直接,适合快速合并。建议合并后监控一次 AMD CI 运行确认新 registry 正常工作。
原始 PR · 作者 DarkSharpness · 合并时间 2026-06-30 23:26
新增 Triton MoE 融合门控内核,替换 CUDA JIT
值得精读的 PR,尤其是 Triton 内核的迭代 top-k 选择策略和 PDL 用法。在采用前应关注数值回归问题,并确认模型准确性。设计上融合了正确性、性能和可维护性,但模型级测试的缺失是当前主要薄弱环节。
原始 PR · 作者 AgainstEntropy · 合并时间 2026-06-30 23:22
支持 Krea-2 Cache-DiT 加速并动态检测 CFG 模式
推荐阅读此 PR,它展示了如何将一个新模型家族(Krea-2)优雅地接入缓存系统,并通过运行时参数解决模型变体间的 CFG 差异问题。设计决策(动态探测 vs 静态注册)值得借鉴,尤其是解决蒸馏模型缓存无效的通用思路。
原始 PR · 作者 Estrella-xx · 合并时间 2026-06-30 19:22
NPU GLM-4.7 MLA 与 MoE 融合算子和配置优化
**不推荐当前状态合并**。需先修复 reviewer 指出的两个 `NameError` 问题,并补充测试覆盖 Context Parallel 和 `q_lora_rank` 为 None 的场景。PR 的融合算子思路正确,但实现安全性和完整度需加强。
默认禁用 DSR1 prefill CUDA graph 以修复 13% 性能回退
可快速合并,该 PR 直接解决已验证的性能回归,代码简洁且测试充分(CI 已通过)。建议后续考虑 reviewer 建议,进行通用化改造,但非当前阻塞项。
原始 PR · 作者 raikonenfnu · 合并时间 2026-06-30 16:24
实现对 Quark W4A8 MXFP4-FP8 量化方案的 AMD 支持
此 PR 值得精读,特别是设计师处理不同量化检查点布局时的思路。关键决策包括:将 per-expert 加载器分离到独立文件、使用环境变量控制内核布局、在自动检测中添加新方案而不破坏现有逻辑。偏好精度测试应尽快补充非 nightly 的冒烟测试以提高 CI 覆盖。
NPU 上支持 DeepSeek V4 Flash MTP 推理
建议对所有文件进行仔细审查,尤其是 `ascend_dsv4_backend.py` 的 multi-step draft backend 实现和 `dsv4_allocator.py` 的状态备份机制。这些设计可复用于其他平台的多步推测解码场景。PR 虽大但模块化较好,值得精读以理解 NPU 上 DSV4 speculative decoding 的全链路。
参与讨论