新增 Qwen3.5-4B FSDP 蒸馏示例脚本
建议用户在使用该脚本前仔细阅读 review 评论并手动调整默认参数(特别是资源分配和 offload 配置)。该脚本可作为蒸馏配置的参考模板,但直接运行时需评估自己的硬件环境。对于维护者,应考虑后续修复评论中指出的问题,尤其是资源默认值和变量命名。
verl: Volcano Engine Reinforcement Learning for LLMs
新增 Qwen3.5-4B FSDP 蒸馏示例脚本
建议用户在使用该脚本前仔细阅读 review 评论并手动调整默认参数(特别是资源分配和 offload 配置)。该脚本可作为蒸馏配置的参考模板,但直接运行时需评估自己的硬件环境。对于维护者,应考虑后续修复评论中指出的问题,尤其是资源默认值和变量命名。
原始 PR · 作者 KadenZhang3321 · 合并时间 2026-06-06 10:21
移除A2 job中的uv改用pip
该 PR 为纯 CI 修复,逻辑简单,可快速合入。值得关注的点:团队在维护多硬件 CI 时通过环境变量统一缓存策略的做法,可供其他基础设施 PR 参考。
修复 MTP 损失中 num_tokens=0 导致的 NaN 与梯度归一化
建议精读,特别是 per-token 损失梯度归一化的设计:MTP 滚动后 token 数减少,需要重新缩放以对齐主损失的 per-token 梯度。这是 Megatron 训练中易被忽视的细节。
回退 Qwen3-8B FSDP NPU 训练脚本到旧版结构
此 PR 为结构清理性质,值得快速了解以理解 NPU 脚本的维护策略变更。未来迭代可考虑将 `MODEL_PATH` 改为可配置环境变量,或在通用脚本中更优雅地处理平台差异。
AMD ROCm 文档索引重构
无需深入阅读,merge 即可;可作为文档组织结构优化的参考案例。
重构 Ascend 文档索引结构
无需特别关注,属于常规文档维护。值得推荐作为文档结构重构的参考范例。
禁止 FSDP2 保存检查点时手动移动模型到 GPU
值得精读。该 PR 展示了 FSDP1 与 FSDP2 在参数卸载/加载上的根本差异,以及如何通过增加一个属性判断来安全处理分支。对于使用 FSDP2 进行全权重训练的团队,此修复关键。
rollout 默认开启 calculate_log_probs
该 PR 简单明了,适合合并。建议确认下游用户是否知晓此默认变更,可在发版说明中提及。
参与讨论