#2781 Add --colocate-memory-peak-device: overlap the trainer/rollout handoff on the GPU
原始 PR · 作者 yueming-yuan · 合并时间 2026-09-01 11:17
gpu 模式重排交接顺序,缓解 GB300 主机内存峰值
值得精读。核心看点是 `train.py` 中 handoff 重排的先后顺序论证,以及 `rollout_manager` 细粒度 offload API 如何与 `offload_rollout_level` 配合达到语义自洽。由于没有单测,建议结合 #2706 的 e2e 验证上下文阅读,并关注后续是否补强测试,尤其是 `cpu` 模式下 `onload_weights` 新增 guard 的兼容性测试。
参与讨论