按 runner 选择 DSV4 eager 区域,修复 MRV1 并恢复 ROCm 默认
值得精读。PR 展示了比配置层"一刀切拒绝"更优雅的解法:把 runner 差异下沉到模型层,用函数指针选择 eager region,既保住 CUDA 的 TTFT 优化,又恢复 ROCm 的 MRV1 性能。对理解 vLLM 的 piecewise cudagraph 捕获机制(`eager_break_during_capture`、`_capturing` 时序)很有价值。需要留意的长期风险是函数指针间接层与配置兜底的移除。
参与讨论