替换 Qwen2.5 测试用例为 Qwen3
该 PR 为常规的 CI 模型升级与清理,技术复杂度较低,但展示了测试脚本演变和 CI 配置管理方式。建议阅读以了解 Ascend 测试用例的组织结构,并留意 reviewer 提出的配置优化建议(如移除冗余 critic 参数)。重点关注 `test_check_profiler_output.py` 中移除计数检查的权衡——在简洁性和严格性之间需根据实际输出特点取舍。
verl: Volcano Engine Reinforcement Learning for LLMs
替换 Qwen2.5 测试用例为 Qwen3
该 PR 为常规的 CI 模型升级与清理,技术复杂度较低,但展示了测试脚本演变和 CI 配置管理方式。建议阅读以了解 Ascend 测试用例的组织结构,并留意 reviewer 提出的配置优化建议(如移除冗余 critic 参数)。重点关注 `test_check_profiler_output.py` 中移除计数检查的权衡——在简洁性和严格性之间需根据实际输出特点取舍。
原始 PR · 作者 nanastassacos · 合并时间 2026-05-22 22:07
修复 FullyAsync 未初始化 _dump_executor 的 bug
本 PR 为一次精准的 bugfix,改动小、风险低,建议快速合并。对于关注 fully_async 功能的开发者,可以留意 _init_dump_executor 和 validation_generations_logger 的后续维护,确保与基类变更保持同步。
修复PPO actor LoRA检查点丢失训练元数据
值得阅读的 PR,展示了如何通过扩展 CheckpointManager 而非修改 trainer 来支持新功能,以及基于分布式后端设计(FSDP vs Megatron)决定是否复用已有机制的权衡决策。review 中关于 Megatron Bridge 的讨论尤其值得关注。
修复 SGLang resume_kv_cache 缺少 free_cache_engine 守卫
建议快速合并,属明确的一行 bugfix,逻辑对称性已验证。
原始 PR · 作者 ETOgaosion · 合并时间 2026-05-22 21:14
升级vLLM至0.20.2,适配FP8和server API
该PR值得仔细阅读,特别是`vllm_fp8_utils.py`中通过unittest.mock.patch适配上游API的“猴子补丁”模式,以及Dockerfile构建参数的抽象策略。这些实践可用于其他类似升级场景。
新增 Qwen3-VL-30B Megatron 启动脚本
该 PR 值得合并,它扩展了 model 覆盖范围。建议后续补充验证结果或与现有 CI 集成。
修复 GRPO shell 脚本中 DEVICE 变量未初始化
此 PR 为小范围 bug 修复,简单直接,值得快速合并。代码审查中提出的风险(stdout 污染、硬件可用性检测)在实际使用中可能性较低(`torch_npu` 在标准安装下不输出 stdout 信息),且社区已有类似用法,可接受。建议未来对类似自动检测逻辑进行统一抽象。
修复 Ascend Docker 构建文档
该 PR 为纯文档更新,建议合并后通知 Ascend 用户。无需深入审查,但可关注文档与目录文件的同步状态。
参与讨论