新增 Qwen3.5-2B 对策略蒸馏 FSDP 双平台脚本
值得精读的人群是需要在 GPU/NPU 双平台跑通 on-policy distillation 的用户,可将其作为 OPD 示例模板;关注 `DEVICE` 自动探测、NPU 环境变量分支和 uv gate 的组合方式。核心代码无改动,评审价值主要体现在示例脚本的可维护性与仓库惯例一致性上。
标签列表
聚合结果
新增 Qwen3.5-2B 对策略蒸馏 FSDP 双平台脚本
值得精读的人群是需要在 GPU/NPU 双平台跑通 on-policy distillation 的用户,可将其作为 OPD 示例模板;关注 `DEVICE` 自动探测、NPU 环境变量分支和 uv gate 的组合方式。核心代码无改动,评审价值主要体现在示例脚本的可维护性与仓库惯例一致性上。
原始 PR · 作者 ChibiQuest · 合并时间 2026-08-29 09:39
更新 30B veomni 脚本的专家并行配置
该 PR 为低优先级的配置调整,不值得精读。可留意其将专家并行大小参数化并默认调整为 8 的做法,这反映了 veomni 在 NPU 上对专家并行的偏好。
DeepSeek V4 支持 QAT bf16 伪量化训练
该 PR 值得关注,因为它引入了新的训练模式(QAT)并增强了 GSPO 损失的灵活性。建议补充单元测试覆盖新配置项和损失聚合逻辑,并确认与 VeOmni 侧 PR 的兼容性。
原始 PR · 作者 ruanhao566 · 合并时间 2026-08-22 17:24
新增 MindSpeed-Bridge 后端,支持 Ascend GDN 优化
该 PR 值得快速浏览:它展示了如何在 verl 示例脚本中通过环境变量开关引入新后端,以及 Hydra `+` 前缀键的用法。若团队正在规划 Ascend 后端支持,可将其作为脚本层参考;但无需精读,也没有核心源码逻辑值得深入分析。
原始 PR · 作者 SkyFishMoon · 合并时间 2026-08-13 17:40
Slurm 示例新增 RAY_NETWORK_INTERFACE 配置,支持绑定指定网卡
值得快速浏览,特别是需要在 Slurm 多网卡集群上部署 verl 的团队。本 PR 的设计体现了「配置化优先、默认行为不变」的原则,通过 srun 动态解析每节点 IP 并显式绑定,确保了正确性和可诊断性。对于示例代码审查者,可关注 srun --overlap 的兼容性和错误处理路径。
VeOmni 引擎新增 DeepSeek V4 支持与 MXFP4 多后端回灌
值得精读。三个设计点有复用价值:一是 `_build_ops_implementation_config` 的「按已安装依赖字段动态过滤 + 显式设置即报错」版本解耦范式;二是 `_mxfp4_staging_data` 通过字节数等价的 view/dtype 重解释复用 live storage,把回灌的额外内存从「整份 MoE」降到「1/16 的 scale 缓冲」;三是回灌流程结束后用 leftover 检查兜底,任何不经过 `replace_parameter` 的路径都会显式失败。需要跟进的事项:为 Marlin 回灌与 converter 路径补专项测试、评估 `max_num_seqs` 全局默认调整、补充与 Megatron 的性能对比数据。
原始 PR · 作者 WenZheWang · 合并时间 2026-07-29 14:12
刷新 FSDP 和 SkyPilot 文档,删除过时多轮示例
推荐阅读以了解当前 FSDP 模型集成路径和 SkyPilot 使用入口。特别是模型集成权限的明确划分值得注意。
将 DAPO 示例脚本重定向到规范启动器
此 PR 展示了一种消除重复配置的实用模式:用带有明确指引的存根替换过时的副本。对于使用 DeepSeek V4 启动器的用户,建议立即迁移到规范启动器;对于仓库维护者,可参考此做法管理其他可能分叉的示例脚本。