多模态 embedding 改用 index_copy_ 合并,削减 prefill 瞬时显存
值得精读。这是一个典型的“PyTorch 高 Layer 算子隐藏瞬时内存分配”的优化案例,展示了如何用 `cumsum` + 哨兵槽位实现低内存且 fail-loud 的 scatter 语义。关注两点设计:一是刻意避免 `torch.where`/`nonzero` 以维持无同步路径,二是用 `num_src_rows` 毒化槽位把行数不匹配变成设备端断言而非静默损坏。若后续在 CUDA 上补齐同样的回归测试,风险将进一步收敛。
参与讨论