对齐separate_async步长与同步训练,新增指标聚合
该 PR 为 BREAKING CHANGE,所有使用 separate_async 训练器的团队都应仔细审查,确认配置和步长语义变更不会破坏现有工作流。MetricsAggregator 的设计思路值得借鉴,可推广到其他异步训练场景。建议作者补充 `num_warmup_batches` 从 4 改为 1 的说明。
verl: Volcano Engine Reinforcement Learning for LLMs
对齐separate_async步长与同步训练,新增指标聚合
该 PR 为 BREAKING CHANGE,所有使用 separate_async 训练器的团队都应仔细审查,确认配置和步长语义变更不会破坏现有工作流。MetricsAggregator 的设计思路值得借鉴,可推广到其他异步训练场景。建议作者补充 `num_warmup_batches` 从 4 改为 1 的说明。
vLLM Prefill-Decode 分离 rollout,支持 NIXL 和 Mooncake
建议精读此 PR,特别是 ZMQ IPC 地址计算、PD role 分配逻辑和 KV Transfer Config 构建。设计上采用进程内 AsyncLLM(而非子进程+HTTP)以适应现有 `collective_rpc` 机制,值得关注。值得注意的是,当前 PD 路径在典型负载下性能低于 colocated,需要明确告知用户预期。
按 GPU 架构和引擎条件设置 CUDA_DEVICE_MAX_CONNECTIONS
建议合并此 PR,但应同步完成 review 中提出的扩展检查范围建议,将 `_uses_megatron` 覆盖到参考策略和奖励模型引擎的策略字段。同时考虑在文档或注释中说明 `get_ppo_ray_runtime_env` 的 config 参数要求,并建议其他调用入口(如单元测试、脚本)同步更新。
原始 PR · 作者 ruanhao566 · 合并时间 2026-07-08 14:52
适配 Qwen3.5 到 Verl 0.8.0 Docker 容器
PR 符合发布准备目标,变更内容合理。但建议考虑优化 Git 克隆策略以加速 Docker 构建(如使用 `git init && git fetch --depth 1 <remote> <commit>` 替代 `git clone && git fetch`),并在未来避免类似低效操作。
原始 PR · 作者 acisseJZhong · 合并时间 2026-07-08 14:23
为 TorchTitan 引擎新增文档与 CI 测试
推荐阅读文档和 CI 配置以理解 TorchTitan 引擎的依赖和部署,CI 模板可用于其他引擎的测试集成。
调整Qwen3 Next 80B NPU GRPO示例配置
该 PR 是配置层面的调整,变更简单且安全,建议合并。对于关注 Ascend NPU 大模型训练稳定的用户,可参考此配置调整。
原始 PR · 作者 chengminhua · 合并时间 2026-07-07 20:02
新增Ascend GSPO Qwen3-8B FSDP2 nightly测试
该PR是标准的CI增强,值得关注其路径兼容性问题,可作为后续改进点。建议在需要非root环境运行时修复。
修复 Mooncake 权重同步中 magic 信号覆盖数据 buffer 导致权重损坏
该 PR 值得精读,尤其对于使用 Mooncake RDMA 多节点训练的团队。修复思路清晰(隔离 side-effect),且第二个 commit 补充的 device synchronize 是对竞态条件的必要防御,显示了作者对 GPU 异步执行模型的理解深度。
参与讨论