削减 MTP spec-v2 主机缝隙开销,GPU 利用率 67% 提升至 95%
值得精读。四个看点:① 对 event_loop_overlap / FutureMap 主机 run-ahead 的分析是理解 SGLang CUDA-graph 调度瓶颈的绝佳材料;② 每个改动独立可回退且附 byte-identical 论证,是性能优化可验收性的范本;③ review 中抓到的 plan-stream 竞态说明此类“搬移 / 融合”改动极易引入时序依赖,值得作为安全检查清单;④ fail-loud(NotImplementedError)与显式门控回退的取舍清晰。