切换 Harmony 处理库到 oss-harmony,移除运行时下载依赖
虽然本 PR 变更量小,但作为后续 GPT-OSS Harmony renderer 的前置基础,建议阅读跟进。对 Rust 依赖管理感兴趣的开发者可关注其如何通过 package 字段重命名 crate 并替换源。
A high-throughput and memory-efficient inference and serving engine for LLMs
切换 Harmony 处理库到 oss-harmony,移除运行时下载依赖
虽然本 PR 变更量小,但作为后续 GPT-OSS Harmony renderer 的前置基础,建议阅读跟进。对 Rust 依赖管理感兴趣的开发者可关注其如何通过 package 字段重命名 crate 并替换源。
原始 PR · 作者 fxmarty-amd · 合并时间 2026-06-26 22:21
修复 CUDA graph capture 在 Triton MoE 的失败
该 PR 是重要的 bugfix,值得快速合并。它展示了 CUDA graph capture 对条件表达式的限制,以及如何通过属性重构优雅解决。
原始 PR · 作者 hongxiayang · 合并时间 2026-06-26 22:05
融合 MiniMax-M3 共享专家到 routed grouped MoE,解码性能提升 5-30%
该 PR 值得仔细阅读,尤其关注以下设计决策: 1. **后端正交设计**:通过 `aiter 操作 or 环境变量` 解耦融合与具体后端,是良好的抽象。 2. **数值等价性权重计算**:`shared_expert_weight = 1/routed_scaling_factor` 保证缩放后贡献匹配。 3. **隐含 bug 修复**:在 `mxfp8_native_moe.py` 中调整 bin 基数,避免融合后 id 越界。 4. **Review 演化**:从新增参数/env 到简化设计并复用现有设施,反映良好协作。
优化 ROCm AITER MoE 权重预处理,提升 DeepSeekV4 性能约 9%
该 PR 是典型的小范围性能优化,改动集中但收益明确。建议 ROCm/DeepSeekV4 用户必须同步升级 AITER 版本;对于追求极致 MoE 推理性能的开发者,值得阅读 `mxfp4.py` 中的权重预处理逻辑以复用模式;注意 `TODO` 后续应跟踪 AITER 修复以移除临时环境变量。
为 MiniMax-M3-MXFP4 启用 AITER MoE 后端
该 PR 展示了如何通过配置扩展 MoE 基础设施以支持新模型的特殊需求,值得关注其临时兼容层的设计模式。建议在 AITER 修复 pad 问题后及时跟进清理。
修复 AMD CI 音频转录测试的随机失败
可直接合并。此 PR 虽小,但体现了在 CI 稳定性维护中通过明确测试参数来消除不确定性的良好实践。
原始 PR · 作者 hyeongyun0916 · 合并时间 2026-06-26 20:02
为 render 端点添加可选 token offsets
值得精读。该 PR 设计严谨(显式能力模型、静态判断优先)、讨论深刻(测试策略、统一调用路径),并明确文档化已知局限。适合作为前端 API 演进的样板 PR。
修复 AITER 升级后 unified attention 分发断言失败
值得精读,特别是对 ROCm 注意力后端的选择和测试模式感兴趣的同学。该 PR 体现了升级上游依赖(AITER)后如何快速定位并修复兼容性问题,以及如何通过声明式约束和测试调整来保证正确性。此外,AMD CI 构建步骤硬失败的配置变更也值得关注。
参与讨论