#46831 [CI/Build][CPU] Add test image cache clean-up
原始 PR · 作者 bigPYJ1151 · 合并时间 2026-06-26 23:28
添加 CPU 测试镜像缓存清理逻辑
该 PR 为增强 CI 基础设施稳健性的良好实践,值得在类似 CI 环境中推广。代码清晰,无功能风险,可直接合并。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 bigPYJ1151 · 合并时间 2026-06-26 23:28
添加 CPU 测试镜像缓存清理逻辑
该 PR 为增强 CI 基础设施稳健性的良好实践,值得在类似 CI 环境中推广。代码清晰,无功能风险,可直接合并。
添加 VLLM_GPU_SYNC_CHECK 环境变量用于检测 GPU-CPU 同步
该 PR 设计精良,值得精读。`gpu_sync_allowed` 的 `first_only` 机制和 monkey-patch 在 torch 编译时模块中的范围扫描尤其值得学习。建议在团队中推广使用 `VLLM_GPU_SYNC_CHECK` 来检测同步回归。
切换 Harmony 处理库到 oss-harmony,移除运行时下载依赖
虽然本 PR 变更量小,但作为后续 GPT-OSS Harmony renderer 的前置基础,建议阅读跟进。对 Rust 依赖管理感兴趣的开发者可关注其如何通过 package 字段重命名 crate 并替换源。
原始 PR · 作者 fxmarty-amd · 合并时间 2026-06-26 22:21
修复 CUDA graph capture 在 Triton MoE 的失败
该 PR 是重要的 bugfix,值得快速合并。它展示了 CUDA graph capture 对条件表达式的限制,以及如何通过属性重构优雅解决。
原始 PR · 作者 hongxiayang · 合并时间 2026-06-26 22:05
融合 MiniMax-M3 共享专家到 routed grouped MoE,解码性能提升 5-30%
该 PR 值得仔细阅读,尤其关注以下设计决策: 1. **后端正交设计**:通过 `aiter 操作 or 环境变量` 解耦融合与具体后端,是良好的抽象。 2. **数值等价性权重计算**:`shared_expert_weight = 1/routed_scaling_factor` 保证缩放后贡献匹配。 3. **隐含 bug 修复**:在 `mxfp8_native_moe.py` 中调整 bin 基数,避免融合后 id 越界。 4. **Review 演化**:从新增参数/env 到简化设计并复用现有设施,反映良好协作。
优化 ROCm AITER MoE 权重预处理,提升 DeepSeekV4 性能约 9%
该 PR 是典型的小范围性能优化,改动集中但收益明确。建议 ROCm/DeepSeekV4 用户必须同步升级 AITER 版本;对于追求极致 MoE 推理性能的开发者,值得阅读 `mxfp4.py` 中的权重预处理逻辑以复用模式;注意 `TODO` 后续应跟踪 AITER 修复以移除临时环境变量。
为 MiniMax-M3-MXFP4 启用 AITER MoE 后端
该 PR 展示了如何通过配置扩展 MoE 基础设施以支持新模型的特殊需求,值得关注其临时兼容层的设计模式。建议在 AITER 修复 pad 问题后及时跟进清理。
修复 AMD CI 音频转录测试的随机失败
可直接合并。此 PR 虽小,但体现了在 CI 稳定性维护中通过明确测试参数来消除不确定性的良好实践。
参与讨论