#48418 [XPU][CI]Adjust timeout_in_minutes in Intel GPU CI
原始 PR · 作者 zxd1997066 · 合并时间 2026-07-13 23:11
调整 Intel GPU CI 超时时间
该 PR 为常规 CI 维护,无需精读。关注点在于后续是否需进一步优化测试性能以降低超时需求。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 zxd1997066 · 合并时间 2026-07-13 23:11
调整 Intel GPU CI 超时时间
该 PR 为常规 CI 维护,无需精读。关注点在于后续是否需进一步优化测试性能以降低超时需求。
修复 Idefics3 图片处理 channels_last 强制错误
建议合并。该 PR 是一个精准的 bugfix,修复了 transformers 升级带来的平台差异问题,实现简洁、讨论充分、风险低。值得关注的是其对 `backend` 属性的处理模式,可作为多模态处理器中类似条件依赖的标准方案。
修复 CUDA graph 捕获时 KV cache 过度分配
简单但重要的 bugfix,值得快速合入。建议阅读 `_init_minimal_kv_cache_for_profiling` 方法了解 profiling 流程。
原始 PR · 作者 yewentao256 · 合并时间 2026-07-13 20:42
拆分 mypy 的 EXCLUDE 路径为按首字母分组
变更清晰简单,可直接合并。若后续有更多子目录需要单独排除,可参考此模式扩展。
为 Rust/Protobuf 添加 SPDX 头部检查
PR 变更直接,不涉及复杂逻辑,但值得学习的是其扩展现有检查器的设计模式(通过 HeaderStyle 统一注释语法)。对于负责 CI/合规的开发者可精读 check_spdx_header.py 的变化。
支持生成模型的 fp32 lm_head
该 PR 值得精读,尤其是 `_apply_head` 中的三路分支设计和平台感知的 fast path 选择。设计决策(CUDA out_dtype vs cast、量化限制、LoRA 拒绝)体现了务实的安全边界。建议关注后续 LoRA 路径实现和更多后端兼容性测试。
原始 PR · 作者 NickLucche · 合并时间 2026-07-13 16:16
修复非 DeepseekV4 模型被错误路由到 tuple-packing 路径
值得快速合并的精确 bugfix。代码简洁,测试覆盖全面(无 SWA、统一 page size、混合 page size 三种场景)。可作为 guard clause 最佳实践参考。
原始 PR · 作者 NickLucche · 合并时间 2026-07-13 16:07
为注意力后端添加滑动窗口能力显式检查
值得精读,作为 vllm 后端能力声明模式的规范示例,同时可关注后续 TODO:滑动窗口 MLA 的官方支持。
参与讨论