Prhub

verl-project/verl · 标签视图

标签列表

聚合结果

distillation 相关 PR

2026-08-31
功能 重要性 5.40 洞察度 4.00

新增 Qwen3.5-2B 对策略蒸馏 FSDP 双平台脚本

值得精读的人群是需要在 GPU/NPU 双平台跑通 on-policy distillation 的用户,可将其作为 OPD 示例模板;关注 `DEVICE` 自动探测、NPU 环境变量分支和 uv gate 的组合方式。核心代码无改动,评审价值主要体现在示例脚本的可维护性与仓库惯例一致性上。

2026-08-03
缺陷修复 重要性 5.37 洞察度 6.00

修复蒸馏损失按微批划分的归一化差异

值得快速精读,重点学习两个点:一是 agg_loss() 的全局归一化机制与 DDP 梯度平均的关系,二是修复信息放置在分支之前的设计决策。PR body 中的定量对比(mb1 vs mb8、fixOff vs fixOn)是很有说服力的验证范例。若团队有蒸馏训练任务,建议尽早合入并留意是否需要补充 micro-batch 相关的回归测试。

2026-07-01
性能优化 重要性 8.59 洞察度 6.00

OPD top-k 蒸馏跳过 log_probs 和 PPO 损失,降低显存占用

本 PR 设计精巧,通过一个标志串联 trainer→engine→loss 的多个模块,是典型的“配置驱动优化”案例。值得精读,尤其关注 FSDP engine 中操作顺序的修复和 Megatron 中 `_distillation_use_topk_active` 的传递方式。建议在后续工作中增加 end-to-end GPU 测试。

2026-06-29

修复 OPD 训练中 teacher 温度配置引发的崩溃

值得快速合并,是一个纯增益的低风险修复。可关注后续项目级日志配置清理 PR。建议阅读 `_get_teacher_sampling_params` 的注释以了解 Hydra 插值导致的配置传播问题。

2026-06-12

#6704 [fsdp] fix: handle missing chunked top-k config

原始 PR · 作者 Luosuu · 合并时间 2026-06-12 14:17

缺陷修复 重要性 4.88 洞察度 3.00

修复 chunked top-k 配置缺失导致的 AttributeError

该 PR 是必要的小修复,值得快速合并。精读价值不高,但可作为向后兼容性处理的典范(使用 `getattr` 加默认值处理可选配置字段)。

2026-06-10
性能优化 重要性 7.88 洞察度 7.00

分块gather-logsumexp避免长上下文OOM

对于从事长上下文蒸馏或大型词表模型训练的开发者,本 PR 值得精读,它展示了在不牺牲数值精度前提下,通过数学恒等变形和分块计算优雅解决 OOM 问题的模式。对于 verl 核心维护者,建议关注后续 PR `_forward_skip_lm_head`,以完全消除 [B,T,V] 张量。其他人可快速了解设计权衡。

2026-06-06
功能 重要性 5.47 洞察度 5.00

新增 Qwen3.5-4B FSDP 蒸馏示例脚本

建议用户在使用该脚本前仔细阅读 review 评论并手动调整默认参数(特别是资源分配和 offload 配置)。该脚本可作为蒸馏配置的参考模板,但直接运行时需评估自己的硬件环境。对于维护者,应考虑后续修复评论中指出的问题,尤其是资源默认值和变量命名。

2026-05-29
功能 重要性 7.01 洞察度 5.00

为 VeOmni 引擎集成 fused top-K 蒸馏核,避免材料化完整 logits

值得精读,尤其是学习如何在引擎层面注入额外张量以支持 fused kernel 的蒸馏功能。输入注入和输出提取的对称设计(eager vs fused 路径输出格式一致)是一个好实践。但需注意该功能目前仅支持 VeOmni backend,且依赖于 veomni 的 bug 修复。