新增 macOS 上 MLX 模型无关单元测试 CI 工作流
建议团队将此工作流纳入 CI 体系,并确保 `mlx` 标签可以正确被维护者用于需要 MLX 测试的 PR。对于关注 Apple Silicon 后端的开发者,值得精读该工作流的设计(标签门控、uv 隔离、强制环境变量),可作为其他供应商 CI 的参考。当前已满足 MLX 基础测试需求,未来可考虑集成模型测试到自托管运行器。
标签列表
聚合结果
新增 macOS 上 MLX 模型无关单元测试 CI 工作流
建议团队将此工作流纳入 CI 体系,并确保 `mlx` 标签可以正确被维护者用于需要 MLX 测试的 PR。对于关注 Apple Silicon 后端的开发者,值得精读该工作流的设计(标签门控、uv 隔离、强制环境变量),可作为其他供应商 CI 的参考。当前已满足 MLX 基础测试需求,未来可考虑集成模型测试到自托管运行器。
原始 PR · 作者 LijuanTang94 · 合并时间 2026-06-11 08:43
使用 kqueue 模拟 PDEATHSIG,修复 macOS 孤儿工作进程泄漏
值得精读,特别是需要跨平台适配的团队。展示了如何利用 kqueue 模拟 Linux 的 PR_SET_PDEATHSIG,以及事件驱动 vs 轮询的设计权衡。模块封装实践也值得参考。
原始 PR · 作者 JINO-ROHIT · 合并时间 2026-05-18 15:49
在安装文档中添加 Apple Metal 链接并更新版本号
该 PR 为简单的文档维护,变更清晰,review 已通过,建议合并。关注点在于确保 `apple_metal.mdx` 页面存在,否则该链接会失效。
MLX 预量化模型配置自动识别
该 PR 修复了实际用户报障且设计上恪守了后端功能隔离原则(所有逻辑位于 `mlx.py`),推荐合并。值得关注的设计决策是:选择复用已有的 `override_quantization_method` 扩展点而非在 `model_config.py` 中增加条件判断,保持了架构整洁。
MLX 后端新增 mlx_q4/q8 即时量化支持
建议精读此 PR,尤其关注以下设计决策:1. 如何通过标记配置类(MlxQuantizationConfig)避免后端代码侵入并行配置架构;2. 如何利用 MLX 元数据在 `_load_model` 中计算内存节省而不强制实例化权重;3. 如何通过 `is_mps()` 条件注册实现平台感知的量化方法集合;4. 测试文件的注册与自动跳过模式,可作为跨平台测试的范式。
原始 PR · 作者 yeahdongcn · 合并时间 2026-05-12 08:54
为 Apple Silicon 添加 Metal kernel 构建支持
值得精读。该 PR 展示了多后端 kernel 仓库的搭建方式,setup_metal.py 的异常处理和 ccache 集成是良好实践。Review 中关于 AOT/JIT 和 IR 接口的讨论具有技术参考价值。
原始 PR · 作者 changminbark · 合并时间 2026-04-30 03:21
MLX 后端实现解码异步重叠调度
**值得精读**。该 PR 展示了如何利用 MLX 的 lazy evaluation 特性设计高效的 GPU 流水线,是 Apple Silicon 推理性能优化的核心里程碑。`SchedulerMlxOverlapMixin` 中的链式调度设计(两图链、链中断条件、`async_eval` 与 `finalize` 分离)具有较高参考价值。后续可以考虑扩展到 prefill/extend 链以及更鲁棒的 KV 缓存管理。
原始 PR · 作者 yeahdongcn · 合并时间 2026-04-24 09:12
缓存BatchedDecodeContext中的派生张量,消除每层重复计算
值得精读。这是一个小而精的性能优化示例,展示了如何通过数据缓存减少冗余计算和主机-设备拷贝,对MLX后端推理性能有明显提升。同时体现了如何通过review迭代采纳建议,最终实现更优方案。对于其他后端的类似模式有参考价值。