Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15

PR 列表

更多筛选
2026-05-15
功能 重要性 7.25 洞察度 7.00

扩展 OAI Triton MoE ROCm 支持至 RDNA4

值得精读:本 PR 展示了在跨平台代码中处理设备功能检测的简洁方法,避免了 capability 元组因供应商实现不同而产生的别名问题。关注点:如何通过字符串匹配(`on_gfx1x`)避免硬编码 capability 数字,以及如何通过集中化辅助函数消除重复。

功能 重要性 9.18 洞察度 6.00

IPC权重同步优化:多GPU支持与分块打包传输

### 建议 该 PR 涉及权重传输核心路径的重要改造,值得 RLHF 开发者精读。重点关注:`packed_tensor.py` 的分块设计、`ipc_engine.py` 的多 GPU 全收集实现、以及 API 变更对下游的影响。建议后续 PR 跟进修复超大张量边界问题,并考虑增加正式 HTTP 分块端点。

#42692 [Bugfix] DFlash FP8 KV-Cache

原始 PR · 作者 benchislett · 合并时间 2026-05-15 22:29

缺陷修复 重要性 5.46 洞察度 4.00

修复 DFlash 与 FP8 KV-Cache 的兼容性崩溃

值得精读,展示了推测解码与 KV-Cache 量化组合时常见的配置传递遗漏问题,可作为类似集成场景的参考。

缺陷修复 重要性 5.74 洞察度 5.00

修复 CPU 上 embedding 模型未编译的问题

该 PR 是 CPU 后端 embedding 模型性能退化的重要修复,建议精读并确认随机种子重置顺序是否需要调整。虽修复核心问题,但种子顺序可能引入隐藏的随机状态一致性问题,建议修复。

#42630 gemma3 multi-gpu bug-fix

原始 PR · 作者 pmaybank · 合并时间 2026-05-15 17:32

缺陷修复 重要性 5.08 洞察度 3.00

修复 Gemma3 多 GPU 下形状不匹配 bug

值得合并,属于典型的一行修复 bug。可快速批准合并。建议未来在类似 `RowParallelLinear` 的使用处也显式指定 `input_is_parallel` 参数以增强可读性。

缺陷修复 重要性 6.01 洞察度 3.00

修复 revision/code_revision 未传递到所有模型加载路径的问题

建议合并。这是正确性问题修复,变更小而专注,有测试覆盖(GGUF 路径),且所有改动的模式一致:在缺少 revision/code_revision 参数传递的地方补上。值得关注的设计决策是统一使用 `model_config.revision` 和 `model_config.code_revision` 作为唯一来源,避免后续新增加载路径再次遗漏。

#42025 [ROCm][CI] Stage B gating

原始 PR · 作者 AndreasKaratzas · 合并时间 2026-05-15 16:49

基础设施 重要性 4.74 洞察度 3.00

AMD CI 第二阶段镜像门禁配置

值得关注该 PR 作为 AMD CI 基础设施分阶段扩展的一部分。建议确保所有 mirror 块包含必要的环境变量,并考虑逐步将 optional 测试提升为强制测试以提高覆盖质量。

参与讨论