#38088 [ROCm][CI] Increase OpenAPI schema test timeouts
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-03-25 18:06
在 ROCm 平台上将 OpenAPI 模式测试超时增加三倍。
此 PR 逻辑简单,适用于快速了解 ROCm 测试调整;无需深度阅读,但可关注平台特定超时设置模式,作为处理异构基础设施的参考。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-03-25 18:06
在 ROCm 平台上将 OpenAPI 模式测试超时增加三倍。
此 PR 逻辑简单,适用于快速了解 ROCm 测试调整;无需深度阅读,但可关注平台特定超时设置模式,作为处理异构基础设施的参考。
原始 PR · 作者 jikunshang · 合并时间 2026-03-25 17:43
在Intel GPU(XPU)上启用MLA模型支持,优化attention后端。
建议重点关注`forward_xpu`方法的实现问题,并查看相关讨论以了解潜在风险。此PR涉及跨平台支持,值得精读以理解MLA在XPU上的集成方式和设计权衡。
重新排序ROCm attention后端优先级,将ROCM_ATTN设为最高优先级,移除环境变量VLLM_ROCM_CUSTOM_PAGED_ATTN。
建议技术管理者和工程师精读此PR,重点关注`_get_backend_priorities`函数的设计决策和优先级调整,以及`sinks`支持变更的权衡。同时,留意未解决的aiter检查问题,可能需要在后续PR中处理。
原始 PR · 作者 chaunceyjiang · 合并时间 2026-03-25 14:19
移除CUDA torch fallbacks,使deep_gemm成为FP8 MQA logits的硬性要求。
建议技术管理者关注此变更对部署环境的兼容性影响,工程师应精读此PR以理解硬件支持与兼容性的设计权衡,特别是review中关于deep_gemm检查的讨论,值得借鉴用于类似决策。
修复 ROCM_AITER_UNIFIED_ATTN 测试中块大小错误,改用动态查询后端偏好。
建议工程师精读此 PR,以学习如何将硬编码配置替换为动态查询,从而提高代码健壮性。关注 `get_preferred_block_size` 方法的使用和测试参数化设计,这对于类似测试场景有借鉴价值。
原始 PR · 作者 chaunceyjiang · 合并时间 2026-03-25 12:06
修复 OpenAI 工具调用流式响应中访问 prev_tool_call_arr 时的索引错误,避免崩溃。
建议工程师精读此 PR 以理解流式处理中工具调用的状态管理逻辑,关注 auto_tool_called 变量的引入和条件检查的调整,这有助于避免类似索引错误;同时注意 review 中提到的死代码问题,可作为代码优化参考。
为vLLM的CUDA Graphs设计文档添加Vision Encoder(ViT)CUDA Graphs详细章节。
建议快速浏览此PR以了解新功能文档,重点关注cuda_graphs_multimodal.md中的设计细节和用法示例。对于技术管理者,可参考文档结构优化模式;对于工程师,无需深入阅读代码,但值得学习文档编写实践。
自动在NFS文件系统上启用模型检查点预取,带RAM保护,提升加载性能。
该PR值得精读,特别关注`_is_nfs_path`和`_checkpoints_fit_in_ram`的实现细节,以及review中关于设计权衡(如条件逻辑和Docker兼容性)的讨论,这对理解vLLM在异构环境下的性能优化策略有参考价值。
参与讨论