修复 DSv4 AITER MoE 权重加载与 shuffle 三大 Bug
建议精读。该 PR 修复了 DeepSeek-V4 在 ROCm 上的关键障碍,并通过一次性能显著提升验证了 AITER FlyDSL MoE 的实用性。尤其值得关注 TP 分片偏移的修正逻辑,以及 AITER 原生 shuffle 函数的对接方式,这为后续其他 MXFP4 后端的同类问题提供了参考。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复 DSv4 AITER MoE 权重加载与 shuffle 三大 Bug
建议精读。该 PR 修复了 DeepSeek-V4 在 ROCm 上的关键障碍,并通过一次性能显著提升验证了 AITER FlyDSL MoE 的实用性。尤其值得关注 TP 分片偏移的修正逻辑,以及 AITER 原生 shuffle 函数的对接方式,这为后续其他 MXFP4 后端的同类问题提供了参考。
RDNA3 原生 W4A16 内核,fp16/bf16 性能飞跃
值得所有 AMD ROCm 平台开发者精读,尤其关注 C++ HIP 内核实现(标量 dot-product vs WMMA 调度、LDS 双缓冲、LLVM 编译器 bug 变通)和 Python 监听门控模式。对于量化推理优化者,该 PR 提供了一个针对消费级 GPU 极致优化的参考案例。
修复 Step3 模型流水线并行中 residual 的 KeyError
值得合并,修复明确且低风险。建议团队后续为流水线并行的 IntermediateTensors 初始化编写单元测试,防止类似问题在新模型中复现。
原始 PR · 作者 NickLucche · 合并时间 2026-05-29 17:40
为 Nixl+SimpleCPUOffload 多连接器添加单元测试
建议开发者查阅本测试了解 MultiConnector 的模拟验证方式,对涉及 Nixl 与 CPU Offload 的贡献者尤其有参考价值。
XPU GDN 注意力支持 MTP 推测解码
该 PR 功能明确、改动集中,值得相关开发人员精读。关注的要点: - 如何将推测解码元数据从 attention metadata 提取并传递给底层内核。 - 使用局部变量统一管理内核参数的模式,便于后续扩展。 - 与 CUDA 端同类实现(参考 `qwen_gdn_linear_attn.py`)的对比可加深对跨平台一致性设计的理解。 - 自动化 review 中提出的代码质量建议虽未完全采纳,但可作为后续代码清洁的切入点。
原始 PR · 作者 simondanielsson · 合并时间 2026-05-29 17:06
修复 ROCm CI 中 MoRI 单元测试被错误跳过的问题
可供快速合并,无重大问题。建议 CI 相关人员了解变更背景,并关注后续 e2e 测试是否按 PR 描述使用 RDMA 后端。
原始 PR · 作者 jikunshang · 合并时间 2026-05-29 17:05
更新 XPU 安装文档中 triton-xpu 版本号
简单文档更新,无需精读。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-05-29 16:43
修复 ROCm AITER cross-attention 共享 KV 缓存布局问题
推荐合并。修正逻辑清晰、变更最小、已通过回归测试。可作为「架构演进中保持后端兼容性」的典型案例精读:展示了在大规模 layout 标准化过程中,如何通过细粒度的条件分支保护混合使用不同布局的共享资源,避免回归。
参与讨论