XPU 上跳过 fused_shared_expert 测试
该 PR 简单直接,无需精读。关注测试跳过策略的合理性,确保未来功能支持时能及时调整。
标签列表
聚合结果
XPU 上跳过 fused_shared_expert 测试
该 PR 简单直接,无需精读。关注测试跳过策略的合理性,确保未来功能支持时能及时调整。
修复 XPU 单测 OOM 与无 graph 死循环
值得 XPU/Intel GPU 相关贡献者精读,重点是"把平台特有测试机制泛化为通用原语"的设计手法:先有 ROCm 的延迟显存回收等待,再通过重命名与平台分支扩展覆盖 XPU,避免复制一份平行实现。对普通读者而言这是一条小而有代表性的测试基建收口 PR,其中 graph 禁用时的 skip 防护模式也可以在其它依赖 CUDA graph/SYCL graph 的用例中复用。
补 XPU 版 forward_xpu,修复 HunyuanOCR 强制 eager 崩溃
建议精读。该 PR 虽小,但清晰展示了 vLLM `CustomOp` 按平台分发的机制(`forward_native` / `forward_cuda` / `forward_xpu`),以及平台适配时如何避免 fallback 到不兼容的通用 kernel。对理解 XPU 支持模式和平台相关 bug 排查有很高参考价值。阅读时可重点关注 `CustomOp.dispatch_forward()` 的路由逻辑与 mrope 在 XPU 上的既有处理对比。
在 XPU 平台启用 Kimi K3 KDA Triton 内核测试
值得快速浏览:这是一个把现有 CUDA 内核测试套件扩展到新硬件平台的典型范本,改动小、边界清晰。重点可关注两点:一是 vLLM 平台抽象(current_platform.device_type / is_cuda_alike / is_xpu)在多硬件测试中的门控用法;二是 gather_initial_states 的断言写法会被后续 XPU/Mamba/KDA 代码复用。若想进一步深入,可顺藤摸瓜阅读 is_flashkda_supported 与 is_fused_kda_decode_supported 的自门控实现,理解 vLLM 如何管理平台相关内核的支持范围。
为 CUDA/XPU 分配器新增 tag 选择性 discard(),细化 sleep/wake_up 状态机
值得精读。该 PR 展示了“内存分配器状态机”这一类基础设施的典型设计手法:用显式状态位(is_asleep)区分已 unmap 与仍 mapped,用幂等告警而非静默变更来应对策略冲突,并在 unmap 前同步设备保证正确性。重点留意 discard() 后访问未唤醒分配的非法地址风险、以及默认 offload_tags=('default',) 的调用陷阱。若要在产品中集成,建议补充策略冲突分支的单元测试并考虑将多次全设备同步合并为一次。
补注册 flashinfer_mxfp4 懒包装,b12x 测试改平台无关
值得快速浏览的小型修复 PR,不需要精读。两个可学习的点:一是 vllm 对 flashinfer 的懒加载包装约定(每个入口函数都要在 vllm/utils/flashinfer.py 手动登记,否则上游 import 与 monkeypatch 都会失败);二是 _mock_b12x_cuda_fp8_platform 用 SimpleNamespace 完整 mock 平台对象的写法,是让依赖特定平台的测试在任意 CI 设备上运行的通用模式。
XPU 线性后端处理 ragged 权重 scale
该 PR 值得 XPU/oneDNN 量化内核维护者精读。设计亮点在于用 `gcd` 选取同时整除 N 与 block_n 的分组宽度,避免新增权重数据,并对不支持的 ragged K 直接 fail loudly;注释也清楚解释了 oneDNN 布局约束。建议补一个针对 N 非对齐 shape 的单元测试,覆盖 `index_select` 索引正确性。
修复非 ROCm 平台导入 rocm 模块引发 torch.cuda 初始化问题
值得快速精读:一是作为“平台相关导入必须加守卫”的参考模板,二是 jikunshang 关于保持短路求值逻辑的 review 讨论很有代表性。若关注 DeepSeek-V4 在非 NVIDIA 平台的部署,本 PR 是前置条件之一。