为 MoE LoRA 启用双 CUDA 图捕获,无适配器批次使用无 LoRA 图以提升解码吞吐量。
该 PR 值得精读,特别是 `cuda_graph_runner.py` 中的变体状态管理和图键设计,展示了如何在 CUDA 图捕获中实现条件分支优化。关注 `_resolve_lora_variant` 如何根据批次动态选择变体,以及 `lora_moe_runners.py` 中捕获时的内核跳过逻辑,这些是性能提升的关键。同时,注意 review 中提到的对齐计算优化点,可作为进一步性能调优的切入点。
参与讨论