Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-07-07
缺陷修复 重要性 6.80 洞察度 5.00

数据并行时自动禁用动态推测解码以防死锁

建议所有涉及配置组合兼容性的开发者阅读此 PR,学习 `_post_init` 中“配置后处理”拦截模式。同时测试用例 `test_dynamic_sd_is_disabled_with_data_parallel` 展示了如何利用 `caplog` 验证警告日志,值得借鉴。

#41359 Bump Transformers version to 5.10.4

原始 PR · 作者 hmellor · 合并时间 2026-07-07 20:13

基础设施 重要性 8.59 洞察度 6.00

升级 Transformers 依赖至 5.10.4 并修复多模块兼容问题

值得精读,尤其是 tokenizer 适配层(`vllm/tokenizers/hf.py`、`vllm/tokenizers/mistral.py`)和多模态处理器(`vllm/model_executor/models/qwen3_vl.py`)的修改,展示了如何在不破坏向后兼容的前提下应对上游 API 重构。

缺陷修复 重要性 5.56 洞察度 3.00

修复 Nemotron MTP 中 lm_head 被重复加载的问题

该 PR 是典型的针对性 bugfix,改动小且风险低,值得快速合并。建议合并后验证 Nemotron 量化模型的精度和 AL 指标。

缺陷修复 重要性 6.90 洞察度 6.00

修复 ModelOpt 混合精度量化的错误推断

建议精读。该 PR 演示了如何将一个过于泛化的回退逻辑精确限定到已知模式,属于谨慎的防御性编程。测试设计值得借鉴:参数化测试覆盖正向(合法融合)和负向(不相关层)场景。

缺陷修复 重要性 6.38 洞察度 6.00

修复 LoRA 下 QKV 融合因缺少 split_sizes 属性导致的崩溃

值得精读,设计决策(用已有属性推导而非存储冗余)值得借鉴。

参与讨论