执行摘要
- 一句话:为Ascend CI新增Qwen3-0.6B和GRPO profiling用例
- 推荐动作:该PR是常规CI维护改进,值得关注其新增测试的模式,可用于参考如何添加新的CI测试。
功能与动机
PR body提到'Fixed some problems of e2e_ppo_trainer_megatron_sglang.yml on Ascend and added more CI cases for maintenance',旨在增加CI测试覆盖以维护代码质量。
实现拆解
- CI工作流新增Qwen3测试任务(
.github/workflows/e2e_ppo_trainer_megatron_sglang_ascend.yml):新增 e2e_ppo_trainer_megatron-qwen3 job,使用Qwen3-0.6B dense模型运行GSM8K E2E测试,验证学习率调度器等特性。
- 新增GRPO profiling测试步骤(同一CI文件):在原有DeepSeek模型测试步骤后新增profiling测试,启动GRPO训练并检查profiling文件是否生成。
- 修复ref模型flash attention配置(
tests/special_e2e/run_ppo_trainer_megatron.sh):移除++actor_rollout_ref.ref.megatron.override_transformer_config.use_flash_attn=True行,该处双加号++在Hydra中可能导致解析错误。
关键文件:
.github/workflows/e2e_ppo_trainer_megatron_sglang_ascend.yml(模块 CI;类别 infra;类型 infrastructure): 新增一个完整的Qwen3测试job和GRPO profiling步骤,是CI扩展的核心。
tests/special_e2e/run_ppo_trainer_megatron.sh(模块 测试脚本;类别 test;类型 test-coverage): 移除ref模型flash attention设置,修复Hydra配置问题。
关键符号:未识别
评论区精华
Gemini Code Assist bot评论指出,移除ref模型的use_flash_attn=True可能导致性能下降或OOM,建议保留并用单加号修正。但该评论未被后续采纳或回复,PR最终被批准合并,说明该配置移除可能是故意的(因双加号Hydra解析问题)或已在其他层面补偿。
- 移除ref模型flash attention配置 (correctness): 该评论未被采纳,PR已被批准合并。可能原因为双加号导致Hydra解析冲突,或flash attention已在actor配置中继承。
风险与影响
- 风险:
- 性能风险:移除ref模型flash attention可能导致NPU上推理变慢,但考虑到actor已启用flash attention且ref通常计算量较小,实际影响可能有限。
- CI稳定性:新增Qwen3测试和profiling测试可能增加CI运行时间,但提高了覆盖。
- 影响:
- CI团队:Ascend E2E CI新增2个测试步骤,覆盖更广泛的模型和特性,有助于早期发现问题。
- 开发者:Qwen3模型在Megatron训练上获得持续验证。
- 用户:间接受益于更可靠的CI。
- 风险标记:CI配置变更, 性能风险(flash attention移除), 缺少review讨论后续
关联脉络
- PR #6876 [ci] chore: add Ascend multinode nightly CI: 同为Ascend CI增强,目标一致。
- PR #6823 [BREAKING][trainer, cfg] chore: enable V1 trainer by default: 涉及trainer配置,可能影响CI测试脚本。
参与讨论