#7050 [rocm] feat: enable DeepSeek-V4-Flash GRPO on AMD GPUs
原始 PR · 作者 PeterYang12 · 合并时间 2026-08-07 16:36
在 AMD GPU 上启用 DeepSeek-V4-Flash GRPO 训练。
值得精读。核心看点有两个:一是 `restore_moe_expert_maps` 以“布局是纯函数、就地位写回维持 CUDA graph 地址”的思路修复 RL 循环中推理引擎的隐藏状态,设计注释非常清晰;二是 refit 触发点(`update_weights_from_ipc` 的 step 1 与 `process_quanted_weights_after_loading`)的选择。阅读时建议同时核对当前 vLLM 版本中这些内部 API 是否仍然存在,并考虑补充一个 CPU 或 ROCm 冒烟测试。