Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-07-25

#49786 [Model] Remove Ouro

原始 PR · 作者 hmellor · 合并时间 2026-07-25 17:50

重构 重要性 7.63 洞察度 1.00

移除废弃的 Ouro 模型实现及注册

值得关注模型清理流程,尤其是如何通过 `_PREVIOUSLY_SUPPORTED_MODELS` 维护向后兼容性。对于模型维护者可参考此 PR 规范废弃模型。

性能优化 重要性 5.87 洞察度 5.00

禁用前缀缓存时跳过LRU哈希分割,解码吞吐提升3.5%

值得快速合并的轻量性能优化。review 过程中揭示的‘GPU 缓存局部性’洞察具有一般性——减少 CPU 工作不是性能提升的唯一来源,数据放置模式同样关键。对于关注 V1 引擎调度和缓存细节的工程师,建议精读 PR #42656 及此 PR,理解 LRU 分割与快速路径的权衡逻辑。

文档 重要性 4.44 洞察度 2.00

修复 nemotron_h.py docstring 缩进警告

该 PR 为纯文档修复,价值在于确保 CI 文档构建通过。可快速合并,无需深入审查。建议关注作者测试方案中使用的 `--strict` 构建模式,该模式可推广至其他文档 PR 以提前发现类似问题。

功能 重要性 7.71 洞察度 4.00

使 PyNvVideoCodec 硬件解码器并发数可配置,默认提升至 2

值得阅读,展示了如何在多模态前端中引入可控并发配置,以及如何保证内存预留与配置一致。对关注视频处理性能和 GPU 资源管理的工程师有参考价值。

缺陷修复 重要性 6.74 洞察度 4.00

修复 ROCm CI 中 GPU 内存残留导致的测试失败

建议合并。该 PR 针对明确的 CI 问题进行修复,改动范围限于测试配置和脚本,逻辑清晰,风险可控。

基础设施 重要性 3.79 洞察度 2.00

强制 AMD CI 编译缓存到本地磁盘

该 PR 虽然代码变动极小(10 行),但背后修复了一个持续的 CI flaky 问题,具有较高的工程价值。阅读者可关注 CI 脚本中环境变量的管理方式:使用 `:=` 还是直接赋值,取决于是否希望允许外部覆盖。对于 CI 内部路径,直接赋值更可控。

参与讨论