#28853 [AMD CI] Add nightly Miles ROCm 7.2 MI350X suites
原始 PR · 作者 XinyuJiangCMU · 合并时间 2026-06-26 18:47
新增 AMD MI350X 夜间测试 workflow
对于 CI 运维和 AMD 平台关注者,建议精读此工作流的镜像解析和矩阵策略设计,可作为类似硬件覆盖的模板。对于一般开发者,只需了解新的夜间测试流程存在即可,无需深入阅读。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 XinyuJiangCMU · 合并时间 2026-06-26 18:47
新增 AMD MI350X 夜间测试 workflow
对于 CI 运维和 AMD 平台关注者,建议精读此工作流的镜像解析和矩阵策略设计,可作为类似硬件覆盖的模板。对于一般开发者,只需了解新的夜间测试流程存在即可,无需深入阅读。
修复 NPU 上 mllama 交叉注意力崩溃问题
该 PR 值得关注,因为它展示了在支持不同注意力模式(自注意力 vs 交叉注意力)时,如何小心处理通用逻辑中的特殊分支。对于类似场景,建议增加单元测试以覆盖多种注意力组合,防止未来回归。
批量radix节点删除事件,降低网络开销
值得精读,尤其是事件设计的权衡:批量 vs 离散。对理解 SGLang KV 事件机制和 radix 缓存清除逻辑有帮助。核心变更简单但经过充分验证,可放心合并。
Playground Docker 镜像选择同步 deployment 逻辑
5
交换双流 MoE 中主/备流分工,路由专家改在主流执行
值得精读,特别是对 CUDA 双流调度和 MoE 执行优化的团队。设计决策清晰(流 assignment 的权衡),且有 profile 数据支撑。建议关注 torch.compile 兼容性风险。
原始 PR · 作者 niehen6174 · 合并时间 2026-06-26 15:46
新增 JoyEcho 多镜头音视频生成支持
值得精读。JoyEcho 的内存银行设计和 DMD 去噪流程是典型的视频生成模型实现示例,对于需要实现类似多镜头机制的开发者有参考价值。SP 处理中对复制前缀与分片后缀的 attention 处理方式(避免 all_gather)也值得关注。建议后续跟踪该 PR 引入的新模型路径的稳定性,以及社区对多镜头生成的支持反馈。
为 GLM-5.2 部署文档添加 NVFP4 量化选项,限定 B300/GB300
值得阅读 `_deployment.jsx` 的镜像键解析变更,这是一个从简单键到复合键的演进,提高了灵活性。GLM-5.2 页面的 cell 设计(TP4、EAGLE 参数等)也可作为 Blackwell Ultra 部署的参考。
为 Cosmos3 添加 CUDA cat/pad 快速路径,提速 ~2x
值得精读。重点关注 `causal_conv3d_cat_pad.py` 中的自定义 op 注册与 fake_impl 设计,以及 `parallel_conv.py` 中的 fallback 模式。该 PR 展示了 JIT 内核与 `torch.compile` 兼容的典型集成方案,对后续扩散模型优化有参考价值。
参与讨论