#46859 [Hardware][AMD][CI] Fix Kernels Quantization test timeout
原始 PR · 作者 mawong-amd · 合并时间 2026-06-27 04:19
修复 AMD CI NVFP4 量化测试超时,临时移除不稳定模型
该 PR 值得合并。建议后续跟踪 `nvidia/Kimi-K2.6-NVFP4` 下载稳定性问题,待网络问题解决后重新添加该模型配置。fixture 设计值得在其他 CI 测试中推广。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 mawong-amd · 合并时间 2026-06-27 04:19
修复 AMD CI NVFP4 量化测试超时,临时移除不稳定模型
该 PR 值得合并。建议后续跟踪 `nvidia/Kimi-K2.6-NVFP4` 下载稳定性问题,待网络问题解决后重新添加该模型配置。fixture 设计值得在其他 CI 测试中推广。
原始 PR · 作者 calvarado2004 · 合并时间 2026-06-27 04:05
修复 DiffusionGemma TP>1 自条件化 matmul 崩溃
值得精读。展示了在 `torch.compile` 编译区域中引入分布式通信的设计模式:通过虚设注册 custom op 使 all-reduce 可追踪,同时保持分片权重避免显存浪费。对于其他需要向量并行 embedding 的模型(如 Mixture of Experts)有借鉴意义。
补齐 parser.parse() 的 token_ids 参数传递
变更明确且安全,已获批准。关注后续解析器迁移 PR 以了解 token_ids 将如何被利用。
修复 macOS CPU 因 OpenMP 缺失导致 attention 死锁
此 PR 是 macOS 平台的重要 bugfix,值得审查。关键设计是通过 `cpu_utils::get_max_threads()` 封装线程数获取,实现非 OpenMP 构建的优雅降级。CI 修改确保了持续验证。
原始 PR · 作者 juliendenize · 合并时间 2026-06-27 02:06
迁移 Voxtral 至 mistral-common 1.11.5 音频 API
该 PR 属于常规维护,展示了如何优雅地上游依赖 API 变化。对于维护多模态模型的开发人员有一定参考价值,但非关键变更,可按需阅读。
调度器测试覆盖 MRV2 路径
建议精读测试中针对 V2 行为差异的断言逻辑,理解 V2 model runner 将抢占恢复视为新请求而非缓存请求的设计意图。
原始 PR · 作者 bigPYJ1151 · 合并时间 2026-06-26 23:28
添加 CPU 测试镜像缓存清理逻辑
该 PR 为增强 CI 基础设施稳健性的良好实践,值得在类似 CI 环境中推广。代码清晰,无功能风险,可直接合并。
添加 VLLM_GPU_SYNC_CHECK 环境变量用于检测 GPU-CPU 同步
该 PR 设计精良,值得精读。`gpu_sync_allowed` 的 `first_only` 机制和 monkey-patch 在 torch 编译时模块中的范围扫描尤其值得学习。建议在团队中推广使用 `VLLM_GPU_SYNC_CHECK` 来检测同步回归。
参与讨论