#6593 [fsdp] feat: chunked gather-logsumexp for top-K loss to avoid OOM at long context
原始 PR · 作者 kekellllll · 合并时间 2026-06-10 11:24
分块gather-logsumexp避免长上下文OOM
对于从事长上下文蒸馏或大型词表模型训练的开发者,本 PR 值得精读,它展示了在不牺牲数值精度前提下,通过数学恒等变形和分块计算优雅解决 OOM 问题的模式。对于 verl 核心维护者,建议关注后续 PR `_forward_skip_lm_head`,以完全消除 [B,T,V] 张量。其他人可快速了解设计权衡。
参与讨论