DSA 模型改为默认走 CUDA 非编译 MRV2 路径
值得精读。这是一个典型的默认路径切换 + 平台分派 PR,建议关注三点:1) `vllm/models/deepseek_v32/__init__.py` 的 CUDA/非 CUDA 导入分派如何与 `registry.py` 解耦并保持类名契约;2) `vllm/config/vllm.py` 中架构集合 + 环境变量自动写入 + `CompilationMode.NONE` 的配置自动决策模式,可作为其他模型默认执行路径的样板;3) capability-gated kernel 与 fallback 的硬件兼容策略。也需注意到其测试主要集中在配置层、真实硬件验证依赖 CI 的代价。
DSV3.2 接入 PCP 分片,fused kernel 物化 K 行,prefill 提升 2.65x
### 阅读建议
值得精读。重点看两处设计决策:一是 `_fused_norm_rope_kernel` 如何用输出指针是否为 None 统一"物化输出"与"直插 cache"两条路径,避免为 PCP 单独维护一份 kernel;二是 `_sparse_indexer_and_attn` 在 PCP 与 DCP 组合下如何完成 K 行汇聚、query all-gather 与 logsum 合并。也建议关注后续是否有 dense MHA 路径 PCP 支持的跟进 PR,以及 PCP+DCP 组合下的数值一致性测试。