Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 19:35 同步状态:空闲 下次计划:2026-08-21 20:35

PR 列表

更多筛选
2026-06-27

#46808 [GLM-5] Add DSV3.2/GLM5 to `vllm/models/`

原始 PR · 作者 WoosukKwon · 合并时间 2026-06-27 05:09

功能 重要性 9.18 洞察度 6.00

添加 DeepSeek V3.2/GLM-5 硬件特定模型实现

建议架构师和模型开发者精读 `attention.py` 中的 `DeepseekV32Indexer` 实现,理解稀疏注意力索引生成逻辑,以及 `model.py` 中的层间残差连接设计,为后续优化奠定基础。

#46851 [ROCm][CI] Fix rlhf_nccl.py on ROCm

原始 PR · 作者 charlifu · 合并时间 2026-06-27 04:41

缺陷修复 重要性 6.17 洞察度 4.00

修复 ROCm 上 RLHF 示例的 RCCL 运行时 bug

此 PR 是一次有针对性的 bug 修复,代码量小且逻辑清晰。值得关注的是其采用的临时方案设计——通过清除环境变量绕过后端 bug,而不是修改核心库。作为 ROCm 平台兼容性修复的示例,可供参考。

基础设施 重要性 3.69 洞察度 2.00

移除 AMD CI mi250 队列中 v1 sample+logits 测试

变更简单直接,无需精读。适合作为 CI 维护参考:当某个测试步骤不再需要时,及时清理以保持流水线高效。

缺陷修复 重要性 6.30 洞察度 4.00

修复 AMD CI NVFP4 量化测试超时,临时移除不稳定模型

该 PR 值得合并。建议后续跟踪 `nvidia/Kimi-K2.6-NVFP4` 下载稳定性问题,待网络问题解决后重新添加该模型配置。fixture 设计值得在其他 CI 测试中推广。

缺陷修复 重要性 6.99 洞察度 7.00

修复 DiffusionGemma TP>1 自条件化 matmul 崩溃

值得精读。展示了在 `torch.compile` 编译区域中引入分布式通信的设计模式:通过虚设注册 custom op 使 all-reduce 可追踪,同时保持分片权重避免显存浪费。对于其他需要向量并行 embedding 的模型(如 Mixture of Experts)有借鉴意义。

缺陷修复 重要性 6.36 洞察度 5.00

修复 macOS CPU 因 OpenMP 缺失导致 attention 死锁

此 PR 是 macOS 平台的重要 bugfix,值得审查。关键设计是通过 `cpu_utils::get_max_threads()` 封装线程数获取,实现非 OpenMP 构建的优雅降级。CI 修改确保了持续验证。

重构 重要性 6.63 洞察度 3.00

迁移 Voxtral 至 mistral-common 1.11.5 音频 API

该 PR 属于常规维护,展示了如何优雅地上游依赖 API 变化。对于维护多模态模型的开发人员有一定参考价值,但非关键变更,可按需阅读。

参与讨论