FSDP/VeOmni 新增 pad_to_length 减少 JIT 重复编译
值得精读的 perf 型 PR。重点关注三处设计:一是“按 attention workload 均衡分 micro-batch 导致 token 数越界,因此必须用细 bucket 而非固定预算对齐”的量化论证;二是 `prepare_model_inputs` 中补位时机(roll 之后、SP 切分之前)与 `_gather_and_unpad_packed` 统一裁剪的配合;三是 router replay 在补位下的掩码处理——补位 token 无 RECORD 记录所以必须 gate 掉走原生路由,而真实 token 打 gate 才会破坏 R2 bit-equal 保证。测试文件对这两个引擎用 `MagicMock` 桩掉 `veomni.*` 依赖的做法也值得复用。
参与讨论