Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-06-22

#46352 Temporarily skip M3 on CI

原始 PR · 作者 ywang96 · 合并时间 2026-06-22 16:35

缺陷修复 重要性 3.54 洞察度 2.00

临时跳过 CI 上的 M3 模型测试

该 PR 属于临时性 CI 修复,技术价值低。但如果负责模型集成或 CI 维护,可关注后续修复 NVIDIA 依赖的正确 PR。

#45940 [Doc] Update MiniMax-M3

原始 PR · 作者 jeejeelee · 合并时间 2026-06-22 16:23

文档 重要性 2.90 洞察度 2.00

更新 MiniMax-M3 文档与测试注册

该 PR 为简单文档维护,无需精读。可作为模型文档同步的参考示例。

功能 重要性 7.92 洞察度 5.00

Rust 前端支持 thinking_token_budget 参数,实现与 Python 前端对等

## 建议 - 该 PR 值得精读,特别是 `normalize_thinking_token_budget` 函数的设计(与 Python 逻辑紧密对齐)以及三个转换层统一透传模式。它展示了 Rust 前端如何通过降层(lowering)集中处理参数验证,保持代码整洁。 - 关注后续跟着的推理解析器传递配套 PR,以完全解决 managed-engine 模式下的功能限制。 - 代码审查中应关注字段解构顺序的脆弱性,但当前设计合理。

功能 重要性 9.18 洞察度 7.00

为 OffloadingConnector 添加自描述 KV 事件

值得精读。本 PR 展示了如何在遗留系统上扩展事件模型以满足外部路由需求,设计上强调兼容性(opt-in、向后兼容)、模块化(独立 events.py)和边界防御(tiering fail-fast)。特别关注 `OffloadingEventsTracker` 的数据流设计:在 store job 构建阶段捕获元数据,在 take_events 阶段消耗,避免了在 worker 进程中保留请求上下文。

重构 重要性 9.00 洞察度 4.00

移除已淘汰的 MiniMax Text-01 和 VL-01 模型架构

该 PR 值得精读,展示了如何安全地淘汰旧模型架构:通过 _PREVIOUSLY_SUPPORTED_MODELS 提供清晰错误提示替代静默失败,同时保留共享组件避免影响其他模型。审查过程也体现了跨团队协作:作者、MoE 专家、工具调用工程师共同确认删除范围。建议团队后续淘汰其他旧架构时参考此流程。

性能优化 重要性 7.37 洞察度 6.00

维护专用 evictable 列表加速 LRU 淘汰

值得精读。该 PR 展示了如何通过数据结构优化消除性能瓶颈,并提供了一种可复用的策略接口设计模式。建议关注 `evictable_blocks` 与 `ref_cnt` 的同步逻辑,以及 Review 中关于接口设计的权衡。

#45939 [1/N][Core] add partial prefix cache primitives

原始 PR · 作者 ZJY0516 · 合并时间 2026-06-22 14:43

功能 重要性 9.18 洞察度 7.00

添加细粒度前缀缓存原语,支持混合模型部分匹配

推荐精读此 PR。它是典型的分步设计范例:先构建核心原语,再逐步对接上层。特别值得关注 `cache_partial_block` 的生命周期管理、`BlockHashToBlockMap` 的多值处理,以及前缀链式哈希的复用策略。

参与讨论