#49422 [XPU][CI] Add more test cases in Intel GPU CI
原始 PR · 作者 zxd1997066 · 合并时间 2026-07-27 12:40
Intel GPU CI 新增多组测试用例
本 PR 是典型的 CI 配置增强,逻辑简单直接,适合作为 Intel GPU CI 配置的参考基线。建议阅读以了解当前 Intel GPU 上的测试覆盖范围,但无需深入审查。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 zxd1997066 · 合并时间 2026-07-27 12:40
Intel GPU CI 新增多组测试用例
本 PR 是典型的 CI 配置增强,逻辑简单直接,适合作为 Intel GPU CI 配置的参考基线。建议阅读以了解当前 Intel GPU 上的测试覆盖范围,但无需深入审查。
原始 PR · 作者 jcotant-inferact · 合并时间 2026-07-27 12:00
为 Kimi 和 K3 添加自动标签规则
该 PR 属于基础设施改进,逻辑清晰、验证充分,可直接合并。建议审阅者在合并后及时创建 `kimi` 和 `k3` 标签,并在 K3 启动阶段结束后按注释移除 `label-k3` 规则和相关标签。
原始 PR · 作者 harjothkhara · 合并时间 2026-07-27 11:53
文档 NVFP4 GEMM 内核选择与 Marlin 回退
文档正确且必要,建议合并。无需深入代码审查,适合快速集成。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-07-27 11:31
AMD CI 原生测试数据集改用本地缓存路径
可直接合并,变更简单且经过审核。可作为 CI 基础设施缓存隔离的参考做法。
暴露 stream_interval 作为请求级采样参数
此 PR 设计简洁,clamp 模式值得在其他请求级参数中借鉴。建议阅读 `vllm/v1/engine/output_processor.py` 中的 clamp 逻辑和测试用例,以理解安全边界的设计思路。
原始 PR · 作者 chaojun-zhang · 合并时间 2026-07-27 11:22
XPU 启用 QK Norm + RoPE 融合编译 pass
值得精读并合并。设计清晰且安全:将条件从 `is_cuda_alike` 扩展到 `is_cuda_alike or is_xpu`,同时将两个 pass 一起移入,保持了平台间的对称性。基准测试数据扎实,证明了性能收益和精度无损。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-07-27 11:19
AMD CI 全局 GPU 内存清理改为 opt-in
建议 AMD CI 维护人员确认相关测试是否已正确设置 `VLLM_TEST_CLEAN_GPU_MEMORY=1`。此 PR 提供了合理的设计决策,值得阅读。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-07-27 11:12
缩减 ROCm V1 attention 测试耗时
建议阅读,特别是 collection-time 参数验证的设计,可推广到其他需要根据运行时能力跳过测试的场景。
参与讨论