Prhub

sgl-project/sglang · 标签视图

标签列表

聚合结果

amd 相关 PR

2026-09-01
功能 重要性 9.18 洞察度 6.00

为 AMD GPU 启用 Kimi-K3 12 头 MLA FP8 Gluon 解码,显著提升长上下文吞吐。

该 PR 值得精读,尤其是以下设计决策:1) **运行时探针与优雅降级模式**:通过 `MlaGluonCapability` 数据类和分层检查(环境变量、导入、API 存在性),实现了对硬件和软件依赖的动态适应,是处理可选硬件加速功能的优秀范例。2) **零填充拓扑的泛化**:将原来的硬编码填充逻辑抽象为 `head_pad_mode`("repeat"/"zero"/"none"),为未来支持其他低头数模型(如 h4, h8)的优化提供了扩展点。3) **最小化变更边界**:尽管涉及核心解码路径,但通过清晰的条件判断和回退机制,确保了对非目标配置的零影响。

基础设施 重要性 2.77 洞察度 2.00

升级 MoRI 依赖,修复 ionic RoCE 上 KV 传输 EOF 错误

作为一行依赖版本升级,无需精读实现细节;但 AMD、hi-cache、disaggregation 相关团队应关注验证结论与 CI 失败项,建议合入前确认 Extra/AMD ROCm 7.2 流水线失败是否与本次 bump 相关。值得关注的设计决策是:将 MoRI 的 pin 放在 Dockerfile ARG 中并附带 NIXL/UCX 构建注释,便于快速定位和追踪上游依赖版本。

2026-08-31

#37225 [AMD] build gfx1250 release image from main

原始 PR · 作者 yctseng0211 · 合并时间 2026-08-31 17:04

基础设施 重要性 4.25 洞察度 3.00

AMD gfx1250 镜像改从 main 构建并转正式发布

值得快速浏览而非精读。对维护 AMD 发布流水线的成员有参考价值,重点注意两个设计决策:(1) 用独立 job 隔离 bring-up 构建失败,避免影响正式发布;(2) tag 从 dev 到 release 的切换时机以构建 stage 是否合入 main 为准。若后续 gfx1250 镜像被 MI450 集群实际消费,应重新评估是否仍需要独立 job,并考虑为发布镜像增加冒烟验证步骤。

#36871 [AMD] support gfx1250 on ROCM 10

原始 PR · 作者 yctseng0211 · 合并时间 2026-08-31 16:19

功能 重要性 9.36 洞察度 7.00

gfx1250 接入 ROCm 10,含内核修复与 MI45x 精度测试

值得精读,尤其是 `aiter_mxfp4_w4a8_moe.py` 与 `triton_qk_rmsnorm.py`。值得关注的决策:1) 对不可用内核采取“成熟 triton 内核 + 布局转换”替代而非修内核;2) 用 IS_GFX1250 constexpr 阻止平台 workaround 泄漏到通用路径;3) 用环境变量矩阵管理多模型精度测试的可复现配置。对维护者:aiter 版本升级(aiter#2958 之后的统一 `fused_qk_rmsnorm` 入口)与 gfx1250 触发条件 `AITER_FORCE_A8W4` 耦合较紧,建议后续引入设备级开关集中管理平台特化逻辑。

2026-08-30

#37092 [AMD] Update v4 amd cookbook 0830

原始 PR · 作者 1am9trash · 合并时间 2026-08-30 14:55

文档 重要性 4.71 洞察度 2.00

更新 DeepSeek-V4 AMD cookbook 配置与镜像标签

建议快速浏览即可,无需精读。值得关注的设计信号是 AMD 团队在 ROCm 7.2 上对 DeepSeek-V4 的推荐参数组合:TORCH_BLAS_PREFER_HIPBLASLT=1 与 16384 chunked-prefill 的搭配;在 AMD 上部署的用户可先小规模验证显存峰值与吞吐后再全量采用。另注意 PR 标题写 0830 而实际镜像标签 bump 到 0829,日期命名略有不一致。

缺陷修复 重要性 7.37 洞察度 8.00

修复 ROCm QuickReduce BF16→FP16 溢出造成的非有限输出

值得精读。核心亮点是三层防御:FP16_OVFL 寄存器饱和兜底、per-codec 的 2 幂范围保护(分析清楚为什么量化 codec 不能用)、显式 ISA 转换阻断编译器重排。提交历史中的 S = 16 → 2 → 1 调参过程展示了如何用端到端 perplexity 和相对 L2 数据驱动数值设计决策,是内核级数值修复的可借鉴范本。建议同时阅读 #37132 的空 asm barrier 替代方案,理解 CDNA 系列 ISA 差异对可移植性的约束。

缺陷修复 重要性 3.12 洞察度 2.00

ROCm 镜像 cherry-pick aiter 提交,修复 v4 fp4 kv-cache 问题

该 PR 改动极小(+2/-0、单文件),技术含量不高,但体现了一个值得注意的维护模式:在依赖 aiter 的 Dockerfile 构建链中以 cherry-pick 方式提前下放上游补丁。适合快速浏览确认构建链语义,无需精读;建议合并后登记跟踪项,确保 aiter 升级时清理。

缺陷修复 重要性 6.06 洞察度 4.00

修复 per-rank MoE 共享专家标记重复发射,杜绝 top-k 缩水与 id 越界

值得精读。这是一个典型的"静默缺陷因果链分析"范例:PR body 把两个无报错缺陷的完整因果链(槽位被占 -> top-k 缩水;id 越界 -> remap 后出界)讲得非常清晰,并诚实评估了端到端 benchmark 的统计分辨力。对于维护 MoE 路由代码的工程师,建议关注 select_experts 中多调用点参数一致性的设计方式,以及后续补充一个构造性单元测试来锁定 top-k 语义与 id 边界。