#5997 [trainer,algo] feat: Support On-Policy Distillation in `main_ppo_sync`
原始 PR · 作者 0oshowero0 · 合并时间 2026-04-17 11:10
在同步PPO训练器中新增基于资源池的在线策略蒸馏支持,打通教师模型与TQ数据流。
该PR值得精读,尤其关注其如何将教师模型集成到现有同步训练框架中。设计决策上,优先支持独立资源池模式而非共置模式,这反映了系统架构向解耦和可扩展性发展的方向。建议重点阅读`transferqueue_utils.py`中KVBatchMeta的适配逻辑,以及`main_ppo_sync.py`中资源池初始化和教师管理器唤醒的时序控制。
参与讨论