跳过 prefix-cache 覆盖项的 mm 张量广播,多模态 TTFT 显著下降
值得精读。该 PR 展示了一个典型的「基于前缀缓存状态做数据传输裁剪」的设计模式:通过 `num_computed_tokens` 判断数据是否必然不会被消费,从而在广播前剥离。重点关注 `strip_covered_mm_data` 的 M-RoPE 特判(`keep_on_cpu`)以及调度器如何传递 `uses_mrope`。同时建议结合 PR#52827 阅读,理解 `keep_on_cpu` 字段语义。对于 v1 runner 的 preemption 场景,若有后续演进可关注是否需要恢复该路径。
参与讨论