#7595 [trainer] feat: Update run_qwen3_30b_veomni configuration
原始 PR · 作者 ChibiQuest · 合并时间 2026-08-29 09:39
更新 30B veomni 脚本的专家并行配置
该 PR 为低优先级的配置调整,不值得精读。可留意其将专家并行大小参数化并默认调整为 8 的做法,这反映了 veomni 在 NPU 上对专家并行的偏好。
标签列表
聚合结果
原始 PR · 作者 ChibiQuest · 合并时间 2026-08-29 09:39
更新 30B veomni 脚本的专家并行配置
该 PR 为低优先级的配置调整,不值得精读。可留意其将专家并行大小参数化并默认调整为 8 的做法,这反映了 veomni 在 NPU 上对专家并行的偏好。
DeepSeek V4 支持 QAT bf16 伪量化训练
该 PR 值得关注,因为它引入了新的训练模式(QAT)并增强了 GSPO 损失的灵活性。建议补充单元测试覆盖新配置项和损失聚合逻辑,并确认与 VeOmni 侧 PR 的兼容性。
原始 PR · 作者 ji-huazhong · 合并时间 2026-08-24 15:14
删除残留 ref.router_replay 配置,修复 Hydra dataclass 实例化报错
值得花 5 分钟快速阅读,作为“配置 schema 与 dataclass 一致性”的典型案例,建议与 #7466 合并阅读。关注点:(1) verl 用 omega_conf_to_dataclass + Hydra struct 模式实例化配置的机制,多余键会直接抛 TypeError;(2) 顶层死配置键如何分两步(#7466 删 actor 侧、本 PR 删 ref 侧)才清理干净;(3) 是否值得在 CI 增加生成配置与 schema 的一致性校验,防止同类回归。
路由索引改 int16,支持超 255 专家并重构回放
值得精读。亮点包括:NCCL 无 int16 时的 uint8 位视图通信模式、用 duplicate-top-k 检测替代显式 replay_mask 的设计取舍、controller 与 engine 的职责划分(controller 不感知形状)。建议阅读时对照 `tests/utils/test_megatron_router_replay_dcp.py` 理解通信层约束,并对照 `verl/workers/utils/padding.py` 的删除逻辑确认数据契约变更范围。
回填扁平化 DSD 检查点缺失优化器状态,修复恢复崩溃
建议精读。改动小但处于训练恢复核心路径,设计上巧妙复用 `optimizer.state_dict()` 的初值来对齐 `allow_partial_load` 语义。值得关注的是缺少单元测试覆盖,可参考 `tests/utils/ckpt/test_lora_custom_object_save_on_cpu.py` 的写法,补一个 CPU 上的扁平化 state dict 回填校验。
FSDP/VeOmni 新增 pad_to_length 减少 JIT 重复编译
值得精读的 perf 型 PR。重点关注三处设计:一是“按 attention workload 均衡分 micro-batch 导致 token 数越界,因此必须用细 bucket 而非固定预算对齐”的量化论证;二是 `prepare_model_inputs` 中补位时机(roll 之后、SP 切分之前)与 `_gather_and_unpad_packed` 统一裁剪的配合;三是 router replay 在补位下的掩码处理——补位 token 无 RECORD 记录所以必须 gate 掉走原生路由,而真实 token 打 gate 才会破坏 R2 bit-equal 保证。测试文件对这两个引擎用 `MagicMock` 桩掉 `veomni.*` 依赖的做法也值得复用。
VeOmni 引擎新增 DeepSeek V4 支持与 MXFP4 多后端回灌
值得精读。三个设计点有复用价值:一是 `_build_ops_implementation_config` 的「按已安装依赖字段动态过滤 + 显式设置即报错」版本解耦范式;二是 `_mxfp4_staging_data` 通过字节数等价的 view/dtype 重解释复用 live storage,把回灌的额外内存从「整份 MoE」降到「1/16 的 scale 缓冲」;三是回灌流程结束后用 leftover 检查兜底,任何不经过 `replace_parameter` 的路径都会显式失败。需要跟进的事项:为 Marlin 回灌与 converter 路径补专项测试、评估 `max_num_seqs` 全局默认调整、补充与 Megatron 的性能对比数据。
修复 GPT-OSS 非 EP 权重导出格式错误
值得精读,重点看 get_moe_param_handler 的"注册表 + 显式拒绝"设计:对未支持路径宁可 fail loud 也不静默产生不兼容数据;以及透传 handler 与默认 handler 统一契约(name, tensor, expert_id_base)带来的可扩展性。建议后续补充 EP 与 delta_sharded 拒绝路径的测试,并将 megatron/delta_export.py 的无关格式改动拆分到独立 PR。