#46808 [GLM-5] Add DSV3.2/GLM5 to `vllm/models/`
原始 PR · 作者 WoosukKwon · 合并时间 2026-06-27 05:09
添加 DeepSeek V3.2/GLM-5 硬件特定模型实现
建议架构师和模型开发者精读 `attention.py` 中的 `DeepseekV32Indexer` 实现,理解稀疏注意力索引生成逻辑,以及 `model.py` 中的层间残差连接设计,为后续优化奠定基础。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 WoosukKwon · 合并时间 2026-06-27 05:09
添加 DeepSeek V3.2/GLM-5 硬件特定模型实现
建议架构师和模型开发者精读 `attention.py` 中的 `DeepseekV32Indexer` 实现,理解稀疏注意力索引生成逻辑,以及 `model.py` 中的层间残差连接设计,为后续优化奠定基础。
修复 ROCm 上 RLHF 示例的 RCCL 运行时 bug
此 PR 是一次有针对性的 bug 修复,代码量小且逻辑清晰。值得关注的是其采用的临时方案设计——通过清除环境变量绕过后端 bug,而不是修改核心库。作为 ROCm 平台兼容性修复的示例,可供参考。
移除 AMD CI mi250 队列中 v1 sample+logits 测试
变更简单直接,无需精读。适合作为 CI 维护参考:当某个测试步骤不再需要时,及时清理以保持流水线高效。
原始 PR · 作者 mawong-amd · 合并时间 2026-06-27 04:19
修复 AMD CI NVFP4 量化测试超时,临时移除不稳定模型
该 PR 值得合并。建议后续跟踪 `nvidia/Kimi-K2.6-NVFP4` 下载稳定性问题,待网络问题解决后重新添加该模型配置。fixture 设计值得在其他 CI 测试中推广。
原始 PR · 作者 calvarado2004 · 合并时间 2026-06-27 04:05
修复 DiffusionGemma TP>1 自条件化 matmul 崩溃
值得精读。展示了在 `torch.compile` 编译区域中引入分布式通信的设计模式:通过虚设注册 custom op 使 all-reduce 可追踪,同时保持分片权重避免显存浪费。对于其他需要向量并行 embedding 的模型(如 Mixture of Experts)有借鉴意义。
补齐 parser.parse() 的 token_ids 参数传递
变更明确且安全,已获批准。关注后续解析器迁移 PR 以了解 token_ids 将如何被利用。
修复 macOS CPU 因 OpenMP 缺失导致 attention 死锁
此 PR 是 macOS 平台的重要 bugfix,值得审查。关键设计是通过 `cpu_utils::get_max_threads()` 封装线程数获取,实现非 OpenMP 构建的优雅降级。CI 修改确保了持续验证。
原始 PR · 作者 juliendenize · 合并时间 2026-06-27 02:06
迁移 Voxtral 至 mistral-common 1.11.5 音频 API
该 PR 属于常规维护,展示了如何优雅地上游依赖 API 变化。对于维护多模态模型的开发人员有一定参考价值,但非关键变更,可按需阅读。
参与讨论