Prhub

verl-project/verl · 标签视图

标签列表

聚合结果

reward 相关 PR

2026-08-11
功能 重要性 8.55 洞察度 7.00

补齐奖励路径全确定性,生成式 RM 按位可复现

值得精读。四个值得关注的设计决策:(1) 将 Ray actor 从装饰器形式改为"普通类 + 实例化时 ray.remote 包装",让框架组件可以被继承覆写,是给核心类开扩展点的通用手法;(2) 用"提交序 vs 完成序"解释 V0/V1 trainer 在确定性上的根本差异——异步流水线里任何依赖完成序的 concat 都无法用 seed 修复,这是设计异步训练引擎的重要教训;(3) flash-attn Triton 交叉熵内核不受 `torch.use_deterministic_algorithms` 约束这一细节,以及用 env 开关强制降级纯 PyTorch 路径的方案;(4) 路由确定性在 rollout 侧(hash + PYTHONHASHSEED,依赖 env 传播)与 RM 侧(crc32,平台无关)采用两套方案的取舍。

2026-06-23
功能 重要性 8.21 洞察度 6.00

实现 V1 PPO 训练器共置奖励模型评分

值得精读,特别是 `_compute_reward_colocate` 的实现和注意力掩码的构建方式,展示了如何在 PPO 训练器中集成共置奖励模型。对应的单元测试设计也值得参考。团队成员应了解 separate_async 模式的限制。

功能 重要性 8.74 洞察度 7.00

为 vLLM rollout 和 reward model 增加完全确定性支持,实现端到端可重现训练

该 PR 值得精读,尤其是以下几点设计决策:1)确定性路由使用 `hash(request_id)` 而非 random 选择,确保跨运行时一致;2)以 priority 作为 request_id 的基础,避免 `uuid4()` 引入的随机性;3)RM 序列化作为 vLLM classify 路径不支持的妥协方案。建议团队在文档中明确说明确定性训练的限制(仅 single-turn Agent Loop、RM max_num_seqs=1、性能开销大),并在启用时使用专用的配置 profile。

2026-06-13
2026-06-12
缺陷修复 重要性 7.81 洞察度 5.00

为 NaiveRewardManager 添加 per-sample 超时机制

建议在以下场景启用:使用自定义 `compute_score` 可能存在性能波动(如基于规则的数学验证、符号计算)时。PR 设计谨慎,适合合入。后续可关注线程安全的超时机制(如 `concurrent.futures` 进程池)以替代信号方案。

2026-06-02
2026-05-09
功能 重要性 7.20 洞察度 5.00

支持多输出轨迹异步奖励评分

此 PR 值得精读,尤其是设计权衡部分(修改 reward manager 接口 vs 调用 score_batch)。它展示了如何在保持向后兼容的同时引入灵活的多输出支持,对理解异步奖励架构有帮助。

2026-05-08
缺陷修复 重要性 6.49 洞察度 5.00

修复 RewardModelConfig 字段命名、world_size 计算和 YAML 配置缺失项

值得精读,尤其是理解 reward model 如何复用 RolloutConfig 以及 world_size 计算公式。设计决策:将 reward 推理配置视为 rollout 配置的复用,并统一字段名 `rollout`。对于正在使用 reward model 的开发者和用户,建议检查现有 YAML 配置是否使用了 `inference` 字段,并及时迁移。关注后续是否会有更多同步配置的工作(例如 NPU 专用配置)。