新增 Qwen3.5-2B 对策略蒸馏 FSDP 双平台脚本
值得精读的人群是需要在 GPU/NPU 双平台跑通 on-policy distillation 的用户,可将其作为 OPD 示例模板;关注 `DEVICE` 自动探测、NPU 环境变量分支和 uv gate 的组合方式。核心代码无改动,评审价值主要体现在示例脚本的可维护性与仓库惯例一致性上。
标签列表
聚合结果
新增 Qwen3.5-2B 对策略蒸馏 FSDP 双平台脚本
值得精读的人群是需要在 GPU/NPU 双平台跑通 on-policy distillation 的用户,可将其作为 OPD 示例模板;关注 `DEVICE` 自动探测、NPU 环境变量分支和 uv gate 的组合方式。核心代码无改动,评审价值主要体现在示例脚本的可维护性与仓库惯例一致性上。
原始 PR · 作者 JacobHelwig · 合并时间 2026-08-03 11:27
修复蒸馏损失按微批划分的归一化差异
值得快速精读,重点学习两个点:一是 agg_loss() 的全局归一化机制与 DDP 梯度平均的关系,二是修复信息放置在分支之前的设计决策。PR body 中的定量对比(mb1 vs mb8、fixOff vs fixOn)是很有说服力的验证范例。若团队有蒸馏训练任务,建议尽早合入并留意是否需要补充 micro-batch 相关的回归测试。
OPD top-k 蒸馏跳过 log_probs 和 PPO 损失,降低显存占用
本 PR 设计精巧,通过一个标志串联 trainer→engine→loss 的多个模块,是典型的“配置驱动优化”案例。值得精读,尤其关注 FSDP engine 中操作顺序的修复和 Megatron 中 `_distillation_use_topk_active` 的传递方式。建议在后续工作中增加 end-to-end GPU 测试。
原始 PR · 作者 kenkenpa2126 · 合并时间 2026-06-29 17:13
修复 OPD 训练中 teacher 温度配置引发的崩溃
值得快速合并,是一个纯增益的低风险修复。可关注后续项目级日志配置清理 PR。建议阅读 `_get_teacher_sampling_params` 的注释以了解 Hydra 插值导致的配置传播问题。
修复 chunked top-k 配置缺失导致的 AttributeError
该 PR 是必要的小修复,值得快速合并。精读价值不高,但可作为向后兼容性处理的典范(使用 `getattr` 加默认值处理可选配置字段)。
原始 PR · 作者 kekellllll · 合并时间 2026-06-10 11:24
分块gather-logsumexp避免长上下文OOM
对于从事长上下文蒸馏或大型词表模型训练的开发者,本 PR 值得精读,它展示了在不牺牲数值精度前提下,通过数学恒等变形和分块计算优雅解决 OOM 问题的模式。对于 verl 核心维护者,建议关注后续 PR `_forward_skip_lm_head`,以完全消除 [B,T,V] 张量。其他人可快速了解设计权衡。
新增 Qwen3.5-4B FSDP 蒸馏示例脚本
建议用户在使用该脚本前仔细阅读 review 评论并手动调整默认参数(特别是资源分配和 offload 配置)。该脚本可作为蒸馏配置的参考模板,但直接运行时需评估自己的硬件环境。对于维护者,应考虑后续修复评论中指出的问题,尤其是资源默认值和变量命名。
为 VeOmni 引擎集成 fused top-K 蒸馏核,避免材料化完整 logits
值得精读,尤其是学习如何在引擎层面注入额外张量以支持 fused kernel 的蒸馏功能。输入注入和输出提取的对称设计(eager vs fused 路径输出格式一致)是一个好实践。但需注意该功能目前仅支持 VeOmni backend,且依赖于 veomni 的 bug 修复。