执行摘要
降低 rollout GPU 内存利用率以修复 OOM
修复 Fully-Async + FSDP 测试中由于配置过高导致的内存不足(OOM)问题,确保 CI 能够稳定运行。
该 PR 值得快速合并,以提升 CI 稳定性。变更内容清晰,无需精读。
无实质讨论。仅有自动化代码审查机器人无意义的评论,以及仓库维护者 wucong25 的直接批准,表明变更简单明确。
修复 Fully-Async + FSDP 测试中由于配置过高导致的内存不足(OOM)问题,确保 CI 能够稳定运行。
该 PR 值得快速合并,以提升 CI 稳定性。变更内容清晰,无需精读。
无实质讨论。仅有自动化代码审查机器人无意义的评论,以及仓库维护者 wucong25 的直接批准,表明变更简单明确。
在 tests/special_e2e/run_fully_async_policy.sh 中,将 actor_rollout_ref.rollout.gpu_memory_utilization 的值从 0.80 改为 0.60,降低 rollout 推理阶段的 GPU 内存占用,避免 OOM。
| 文件 | 模块 | 状态 | 重要度 |
|---|---|---|---|
tests/special_e2e/run_fully_async_policy.sh |
测试脚本 | modified | 3.7 |
分析完成后,这里会展示 LLM 生成的相对完整源码片段和详细注释。
当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。
风险极低。变更仅涉及测试配置参数,且目的是减少内存使用,不会引入新功能或破坏现有逻辑。唯一潜在影响是测试环境可能需要更长时间完成,但属于可接受范围。
直接影响 Fully-Async + FSDP 端到端测试的 GPU 内存占用,使其在 CI 环境下不因 OOM 而失败。对其他测试、产品代码或用户无影响。
当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。
参与讨论