Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 19:35 同步状态:空闲 下次计划:2026-08-21 20:35

PR 列表

更多筛选
2026-06-10

#45127 [Model] Remove obsolete ERNIE models

原始 PR · 作者 xianbaoqian · 合并时间 2026-06-10 20:54

重构 重要性 8.59 洞察度 5.00

删除低使用率的 ERNIE BERT 式池化模型

可精读以下设计要点: - 如何基于使用率数据(遥测)做代码功能退役决策。 - 如何通过 `_PREVIOUSLY_SUPPORTED_MODELS` 处理功能删除后的向后兼容性。 - 测试删除时如何同步清理测试用例和示例模型条目。 该 PR 是 vLLM 模型管理策略的典型案例,值得模型运维和代码清理相关开发人员关注。

#35669 Feature/offloading manager stats

原始 PR · 作者 Srinivasoo7 · 合并时间 2026-06-10 20:44

功能 重要性 9.13 洞察度 6.00

为KV offload管理器添加标准化Telemetry接口

该PR值得深度阅读,特别是对设计可扩展监控系统的开发者。关键决策在于自描述扁平统计载荷的设计和deprecation迁移策略。建议结合RFC(#44008)形成的指标重设计思路来理解整体演进方向。

缺陷修复 重要性 8.58 洞察度 4.00

修复 Rust Tokenizer 遗漏 tokenizer_config.json 中的 added tokens

此 PR 值得合并,它修复了一个关键的多模态模型兼容性 bug。设计上采用合并策略,优先保留 tokenizer.json 中的 token,安全可靠。建议后续关注 fastokens 上游修复的进展,如果上游已支持 added_tokens_decoder,可简化 Rust 端的合并逻辑。同时建议增加更多边界测试,如 id 冲突、非数字 key、大并发加载等场景。

基础设施 重要性 7.48 洞察度 4.00

统一 Rust 构件构建入口为 setuptools-rust

建议关注其“单一入口”设计模式——未来扩展 Rust 模块只需在 `tools/build_rust.py` 中添加 `RustExtension` 条目,其余环节自动适配。值得精读 `tools/build_rust.py` 和 `setup.py` 的改动以理解共享构建的原理。

缺陷修复 重要性 6.42 洞察度 6.00

修复远程 DoS:Triton 采样器越界 token 掩码为 -inf

值得精读。展示了 Triton kernel 边界条件下安全加固的典型模式,且测试用例设计技巧(零概率尾部、无草案概率路径覆盖)有参考价值。安全团队和推测解码功能开发者应重点关注。

缺陷修复 重要性 4.82 洞察度 2.00

修复 XPU FlashAttention 接口参数缺失

此 PR 为一次性接口同步修复,变更清晰简单,无需精读。但对于维护 XPU 后端的工程师,建议后续关注 CUDA 端对该两参数的实现,并在 XPU kernel 中提供对应支持。

#45011 [Refactor] Rename rocm_moe.py to rocm_moe_rdna.py

原始 PR · 作者 JartX · 合并时间 2026-06-10 17:02

重构 重要性 5.49 洞察度 3.00

重命名 ROCm MoE 模块,明确 RDNA3 目标

本 PR 是一次安全的重命名操作,值得快速合并。它虽然没有功能改进,但提升了代码可维护性,并解决了潜在的命名隐患。对于关注 ROCm 量化路线图的工程师,建议留意后续可能新增的 `rocm_moe_rdna4.py` 等文件。

参与讨论