#1882 fix ppo value offload bugs
原始 PR · 作者 lilei199908 · 合并时间 2026-05-06 12:39
修复PPO使用critic时的offload训练bug
建议精读。本PR修复了PPO多角色offload训练中的关键状态管理问题,展示了异步训练中actor与rollout引擎连接维护的典型解决方案:sleep前断开、wake后重建。design_pattern值得参考,特别是disconnect/connect的显式化。另外参数强制绑定的策略也值得讨论——究竟是缺陷修复还是约束收紧,不同团队可能有不同偏好。
参与讨论