DeepSeek V4 支持 QAT bf16 伪量化训练
该 PR 值得关注,因为它引入了新的训练模式(QAT)并增强了 GSPO 损失的灵活性。建议补充单元测试覆盖新配置项和损失聚合逻辑,并确认与 VeOmni 侧 PR 的兼容性。
标签列表
聚合结果
DeepSeek V4 支持 QAT bf16 伪量化训练
该 PR 值得关注,因为它引入了新的训练模式(QAT)并增强了 GSPO 损失的灵活性。建议补充单元测试覆盖新配置项和损失聚合逻辑,并确认与 VeOmni 侧 PR 的兼容性。
修复 REINFORCE++ 多轮观察段奖励丢失
值得精读。这是一个小而精准的正确性修复:展示了如何用与 GAE 一致的 carry-through 模式统一处理 response_mask 的双重语义,避免在同一代码库中出现两套不一致的 mask 行为。测试设计覆盖了核心回归、gamma 折扣、padding、batch 和单轮兼容性,可作为 RL 算法修改的测试范例。建议重点关注 running_return 选择逻辑与测试中对 observation/padding 的区分。
新增 DRO 策略损失及 dro_beta 配置
值得快速精读,核心价值在于展示如何新增一个注册式策略损失并与统一聚合、rollout 校正权重对接。实现短小清晰,可作为后续扩展其他 policy loss 的样板。建议关注 `agg_loss` 的复用方式以及 `dro_beta` 的运行时校验设计;若团队计划推广 DRO,建议补充 GPU 冒烟测试和 beta 超参建议。
新增 token-sum 损失聚合模式,支持 DP 缩放
该 PR 代码量小、逻辑直白,但其中“乘 dp_size 抵消 DDP/FSDP 平均”的推导值得精读,是一个典型的并行训练损失语义设计。建议阅读 agg_loss 全函数和三个测试用例,理解 token-sum 与 token-mean 在梯度尺度上的差异。对于计划在多卡或 Megatron 后端使用该模式的团队,建议等待后续专门适配或自行验证。
原始 PR · 作者 JacobHelwig · 合并时间 2026-08-03 11:27
修复蒸馏损失按微批划分的归一化差异
值得快速精读,重点学习两个点:一是 agg_loss() 的全局归一化机制与 DDP 梯度平均的关系,二是修复信息放置在分支之前的设计决策。PR body 中的定量对比(mb1 vs mb8、fixOff vs fixOn)是很有说服力的验证范例。若团队有蒸馏训练任务,建议尽早合入并留意是否需要补充 micro-batch 相关的回归测试。
为 Megatron 后端添加 Muon 优化器支持
此 PR 值得精读,尤其是 `adamw_rms_match_scale_factor` 的推导和实验对比方法。代码设计上对兼容性的处理(字段白名单转发、fail-closed)和 DDP 封装的重构(`wrap_model_chunks_with_layerwise_aware_ddp`)均具有参考价值。建议使用者优先配置 `muon_match_adamw_update_rms` 而非手动设置常量。
V1 separate_async 支持解耦 PPO
值得精读。该 PR 展示了如何在现有异步训练框架中支持高级算法(Decoupled PPO),特别是通过 CPU 权重快照实现多步旧策略一致性的设计模式。评审过程展现了好的代码质量实践——将状态追踪移入基类、统一索引约定。建议关注后续对 DetachActorWorker 的测试覆盖和稳定性。
统一 V1 ReplayBuffer 对过期/DAPO 过滤/失败 rollout 组的驱逐回填
本 PR 值得精读,因为它实现了 DAPO 算法的采样支持,并展示了 ver_l 框架的可扩展设计(类分离、工厂方法、配置驱动)。review 中的技术讨论(P1-P3)对理解工程权衡很有帮助。建议计划使用 DAPO 的团队仔细阅读 PR body 中的配置矩阵,并在实验前确认 `max_num_gen_batches` 的警告已生效。对于 `_dapo_filtered_keys` 的性能优化(缓存)可作为后续改进项。