Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 18:24 同步状态:空闲 下次计划:2026-08-21 19:24

PR 列表

更多筛选
2026-06-09

#44450 [Model Runner V2] Fix mrv2 mm lora issue

原始 PR · 作者 yewentao256 · 合并时间 2026-06-09 02:30

缺陷修复 重要性 7.74 洞察度 5.00

修复 V2 模型运行器多模态 LoRA 映射未设置导致测试失败

此 PR 修复明确,测试充分,建议立即合并。值得关注的设计是将 LoRA 激活与多模态 embedding 生成解耦到独立模块,未来维护时可借鉴。

2026-06-08
重构 重要性 6.93 洞察度 4.00

提取 CPU 注意力后端 KV 缓存更新为独立方法

该 PR 是架构统一工作的重要一环,建议关注 `do_kv_cache_update` 的设计模式(保护上移、动态 ISA 推导)。如果有 CPU 注意力相关开发,值得精读;如果仅关注 GPU 后端,了解接口变更即可。

重构 重要性 9.48 洞察度 8.00

MoE 层所有权反转与模块化重构

强烈建议技术负责人和核心开发者深入阅读此 PR,它展示了通过职责反转和接口抽象进行大型重构的最佳实践。重点关注: - `RoutedExperts` 如何从原 `FusedMoE` 剥离并独立管理权重。 - `MoERunnerInterface` 定义的契约如何实现前向逻辑与权重管理的解耦。 - 权重加载重映射的实现(`weight_utils.py` 中的新函数)。 - 讨论中关于未来提升 `MoERunner` 层级的建议。

#44132 [Quantization] add online fp8 ptpc

原始 PR · 作者 walterbm · 合并时间 2026-06-08 22:42

功能 重要性 9.00 洞察度 6.00

新增在线 FP8 per-channel 量化方法

值得精读,展示了在线量化框架的扩展方式,包括量化键(QuantKey)、调度表注册、MoE 集成以及测试策略。关注 MarlinFP8 兼容性检查和 ROCm 缺失问题。

性能优化 重要性 8.12 洞察度 6.00

基准测试自动对齐 tokenizer 差异

**值得精读**:PR 展示了一个优雅的“即插即用”方案:零侵入、零配置、自动感知并修复,代码简洁(约 80 行)。其设计思路(探测 + 告警 + 全量修复)和并发控制方式可作为类似问题的参考。特别适合需要长时间运行 benchmark 并比较不同版本/模型的团队。

#44819 [CI] Consolidate multimodal entrypoint tests.

原始 PR · 作者 noooop · 合并时间 2026-06-08 19:48

测试 重要性 5.95 洞察度 3.00

合并多模态入口测试文件并统一资源管理

值得快速阅读。该 PR 展示了测试目录布局规范化的实践:通过 `conftest.py` 共享常量和按功能域组织测试文件,对后续多模态测试扩展具有参考价值。但由于无核心逻辑变动,不强制深度审查。

参与讨论