修复 prefix-LM 纯文本部署时 attention backend 被错误排除
该 PR 设计清晰、测试完善,建议合并。值得关注其缓存设计和对 Registry 的依赖,可作为类似配置动态清除的参考模式。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复 prefix-LM 纯文本部署时 attention backend 被错误排除
该 PR 设计清晰、测试完善,建议合并。值得关注其缓存设计和对 Registry 的依赖,可作为类似配置动态清除的参考模式。
移除废弃的 Ouro 模型实现及注册
值得关注模型清理流程,尤其是如何通过 `_PREVIOUSLY_SUPPORTED_MODELS` 维护向后兼容性。对于模型维护者可参考此 PR 规范废弃模型。
禁用前缀缓存时跳过LRU哈希分割,解码吞吐提升3.5%
值得快速合并的轻量性能优化。review 过程中揭示的‘GPU 缓存局部性’洞察具有一般性——减少 CPU 工作不是性能提升的唯一来源,数据放置模式同样关键。对于关注 V1 引擎调度和缓存细节的工程师,建议精读 PR #42656 及此 PR,理解 LRU 分割与快速路径的权衡逻辑。
原始 PR · 作者 Johnny-Liou · 合并时间 2026-07-25 15:33
修复 nemotron_h.py docstring 缩进警告
该 PR 为纯文档修复,价值在于确保 CI 文档构建通过。可快速合并,无需深入审查。建议关注作者测试方案中使用的 `--strict` 构建模式,该模式可推广至其他文档 PR 以提前发现类似问题。
原始 PR · 作者 brandonpelfrey · 合并时间 2026-07-25 14:31
使 PyNvVideoCodec 硬件解码器并发数可配置,默认提升至 2
值得阅读,展示了如何在多模态前端中引入可控并发配置,以及如何保证内存预留与配置一致。对关注视频处理性能和 GPU 资源管理的工程师有参考价值。
原始 PR · 作者 aarushjain29 · 合并时间 2026-07-25 12:21
修复 ROCm CI 中 GPU 内存残留导致的测试失败
建议合并。该 PR 针对明确的 CI 问题进行修复,改动范围限于测试配置和脚本,逻辑清晰,风险可控。
原始 PR · 作者 divakar-amd · 合并时间 2026-07-25 12:15
重构测试编译缓存禁用方式,修复 CI 不稳定
值得快速合并。该 PR 解决了实际 CI 问题,且重构后代码更清晰、更 DRY。建议团队在后续类似测试中优先使用 `disable_vllm_compile_cache` fixture。
原始 PR · 作者 aarushjain29 · 合并时间 2026-07-25 12:14
强制 AMD CI 编译缓存到本地磁盘
该 PR 虽然代码变动极小(10 行),但背后修复了一个持续的 CI flaky 问题,具有较高的工程价值。阅读者可关注 CI 脚本中环境变量的管理方式:使用 `:=` 还是直接赋值,取决于是否希望允许外部覆盖。对于 CI 内部路径,直接赋值更可控。
参与讨论