#7005 [fsdp] fix: skip the whole-shard staging round trip in FSDP2 weight export
原始 PR · 作者 ChangyiYang · 合并时间 2026-07-10 16:45
跳过 FSDP2 非必要全分片 staging
值得精读。该 PR 展示了理解底层框架(FSDP1 vs FSDP2)差异后,如何通过删减冗余操作实现显著性能收益,且变更极小(+9/-2)。也是编译器级优化在工程中的经典范例。
verl: Volcano Engine Reinforcement Learning for LLMs
原始 PR · 作者 ChangyiYang · 合并时间 2026-07-10 16:45
跳过 FSDP2 非必要全分片 staging
值得精读。该 PR 展示了理解底层框架(FSDP1 vs FSDP2)差异后,如何通过删减冗余操作实现显著性能收益,且变更极小(+9/-2)。也是编译器级优化在工程中的经典范例。
原始 PR · 作者 mikequan0425 · 合并时间 2026-07-10 15:54
将 SkipManager 适配到 Trainer V1,支持 rollout TQ 批缓存与重放。
值得精读。该 PR 展示了如何将已有 SkipManager 模式扩展到新的 Trainer 架构,设计上采用装饰器模式实现了低侵入性改造,对理解 V1 Trainer 的数据流和 SkipManager 扩展机制有很好的学习价值。建议关注后续可能的重构(如统一 SkipBase 类)和 CI 集成。
添加 HY V3 Megatron GRPO 训练示例与 FLOPs 估算
该 PR 提供了实用的模型支持,值得用户参考。但应留意 `use_mbridge` 的过时问题,建议尽快为 FLOPs 估算函数补充单元测试,并在后续迭代中迁移至原生 Megatron-Bridge 配置。
修正 A5 安装文档中 vLLM-Ascend 的 cherry-pick commit hash
该 PR 是典型的 bugfix 文档更新,价值在于确保安装指南的准确性。对于一般读者无需特别关注,但对于 A5 平台的用户具有实际指导意义。
更新 A5 安装文档说明
该 PR 为简单的文档修正,无需深入阅读。可合并。
统一 VeOmni MoE 参数处理为默认 fallback
建议合并。该 PR 修复了一个 MoE 参数处理的缺陷,使 VeOmni 引擎能自动处理所有模型的 `gate_up_proj` 拆分,消除了对显式注册的依赖。虽然改动小(仅 2 个文件 5 行增加 7 行删除),但修复逻辑清晰,风险低。
原始 PR · 作者 ruanhao566 · 合并时间 2026-07-09 19:08
规避 vLLM 多模态缓存问题并新增 Qwen3.5 397B 支持
该 PR 为示例配置与文档更新,适合在 Ascend NPU 上部署 Qwen3.5 模型的用户参考。建议精读新脚本中的并行度选择、MoE 通信策略(`alltoall`)和张量归一化(`use_naive_l2norm`)的设置,理解超大模型训练的资源分配方式。
更新 Atlas 950DT A5 安装文档依赖版本与命令
此 PR 为常规文档维护,无特殊设计决策,建议快速合并。
参与讨论