支持流式数据加载与异步训练器检查点恢复
建议团队精读本 PR,特别是 `_reissue_inflight_prompts`、`_add_batch_to_generate` 和 `ReplayBuffer` 的 drop/refill 实现,是异步训练器检查点恢复的核心。注意 review 中已识别的忙等待和共享引用问题需确认已修复(最终合并版本可能已包含)。
verl: Volcano Engine Reinforcement Learning for LLMs
支持流式数据加载与异步训练器检查点恢复
建议团队精读本 PR,特别是 `_reissue_inflight_prompts`、`_add_batch_to_generate` 和 `ReplayBuffer` 的 drop/refill 实现,是异步训练器检查点恢复的核心。注意 review 中已识别的忙等待和共享引用问题需确认已修复(最终合并版本可能已包含)。
在 vLLM 引擎 logits 中屏蔽视觉占位符 token,防止训练崩溃
该 PR 的修复方案(engine 层 logits mask 取代 per-request bad_words)是处理此类问题的正确模式,值得相关后端开发人员深入理解。讨论中涉及的安全性权衡(setdefault 漏洞、MTP drafter 覆盖、兼容性)也很有参考价值。建议合并并尽快推动其余后端的适配。
原始 PR · 作者 HollowMan6 · 合并时间 2026-07-14 16:29
支持 DeepSeek V4 Flash GRPO 训练
此 PR 值得精读,特别是: 1. 如何为一个全新的 MoE 模型添加端到端 GRPO 训练支持,包括量化权重同步和路由重放。 2. 审查中关于 API 设计(DSV4 工具分离)和安全编码(getattr、异常处理)的讨论是很好的实践参考。 3. 二进制传输中对齐(_align_offset)和异步 ZMQ 的优化思路。 建议重点关注 MTP drafter 覆盖率缺失的问题,在后续迭代中解决。
修复 VeOmni CI 测试中 MoE 处理函数获取失败问题
PR 内容明确,改动简单且正确,建议合并。可作为理解 VeOmni MoE 参数处理机制的小案例阅读。
原始 PR · 作者 mikequan0425 · 合并时间 2026-07-14 10:04
SkipManager 支持参数同步步长内多批量缓存
建议在后续 PR 中解决 review 指出的两个问题:保持 parameter_sync_step == 1 时向后兼容,以及清理不完整步骤目录。当前版本可用于实验,但生产部署需谨慎。该 PR 展示了 SkipManager 对 separate async 模式的适配思路,值得了解目录结构和合并逻辑。
原始 PR · 作者 ruanhao566 · 合并时间 2026-07-13 19:44
同步 Qwen3.5 Dockerfile 并固定 PyArrow 版本
值得精读 Dockerfile 以了解 Qwen3.5 在 Ascend 上的环境依赖。但 git clone 策略建议参考 bot 意见改进,以免后续 CI 构建不稳定。
禁用 vLLM 多模态处理器缓存修复
值得精读。该 PR 展示了一个典型的上游兼容性修复模式:在引擎初始化前通过版本检测注入 workaround,同时保留用户覆写路径。适合作为多模态训练中缓存问题处理的参考。
原始 PR · 作者 EricMarcus-ai · 合并时间 2026-07-13 10:57
修复 Megatron CP>1 时 MoE aux/z-loss 梯度爆炸
强烈建议使用 Megatron MoE 且 CP>1 的用户合入此 PR。值得关注的设计决策:精确计算路由 token 数的 `_routed_num_tokens` 方法、通过预乘后除抵消的二阶段归一化策略、以及对不合理配置的主动防护。
参与讨论