修复 RewardModelConfig 字段命名、world_size 计算和 YAML 配置缺失项
值得精读,尤其是理解 reward model 如何复用 RolloutConfig 以及 world_size 计算公式。设计决策:将 reward 推理配置视为 rollout 配置的复用,并统一字段名 `rollout`。对于正在使用 reward model 的开发者和用户,建议检查现有 YAML 配置是否使用了 `inference` 字段,并及时迁移。关注后续是否会有更多同步配置的工作(例如 NPU 专用配置)。
参与讨论