Ascend 镜像改两阶段推送,规避 Quay GC 销毁中间镜像
建议镜像发布与 CI 维护同学精读该 PR:两阶段推送、digest 传递、防 GC tag、凭据隔离的组合是容器镜像 CI 的通用最佳实践。对一般训练框架使用者无需关注。后续可改进的点:将临时仓库迁移到组织级命名空间以消除单点依赖;为 merge 阶段补充 `DIGESTS` 为空时的显式失败断言;统一 a2/a3 的临时 tag 命名风格。
verl: Volcano Engine Reinforcement Learning for LLMs
Ascend 镜像改两阶段推送,规避 Quay GC 销毁中间镜像
建议镜像发布与 CI 维护同学精读该 PR:两阶段推送、digest 传递、防 GC tag、凭据隔离的组合是容器镜像 CI 的通用最佳实践。对一般训练框架使用者无需关注。后续可改进的点:将临时仓库迁移到组织级命名空间以消除单点依赖;为 merge 阶段补充 `DIGESTS` 为空时的显式失败断言;统一 a2/a3 的临时 tag 命名风格。
原始 PR · 作者 ChibiQuest · 合并时间 2026-08-29 09:39
更新 30B veomni 脚本的专家并行配置
该 PR 为低优先级的配置调整,不值得精读。可留意其将专家并行大小参数化并默认调整为 8 的做法,这反映了 veomni 在 NPU 上对专家并行的偏好。
增大合成 padding 序列长度,适配上下文并行
本 PR 是关键的 bugfix,建议阅读 padding_utils.py 中的相关实现,理解为何较小的 padding 序列在 CP 下会导致问题。关注其未配套测试的风险,可在后续 PR 中补充覆盖不同 CP 大小的测试用例。
重组 Ascend 教程为中英目录并迁移 CI 到 a3
- 值得快速浏览 `zh/index.rst` 与 `en/index.rst` 的拆分方式,了解多语言文档在 Sphinx 中的组织模式。 - 关注 CI 迁移后第一个夜间运行的 `model_ascend.yml` 是否稳定,若 a3 镜像缺失需及时回退。 - 若团队后续维护 Ascend 文档,建议遵循 `zh/`、`en/` 目录约定,避免再次出现 `_zh/_en` 后缀冗余。
DeepSeek V4 支持 QAT bf16 伪量化训练
该 PR 值得关注,因为它引入了新的训练模式(QAT)并增强了 GSPO 损失的灵活性。建议补充单元测试覆盖新配置项和损失聚合逻辑,并确认与 VeOmni 侧 PR 的兼容性。
原始 PR · 作者 Mengyuyang · 合并时间 2026-08-28 10:31
FSDP 延迟梯度同步新增开关,实际默认改为 false
值得精读,尤其是 `_gradient_sync_context` 的 `getattr` 兼容写法与配置默认值在数据类/YAML 两层的分歧。建议关注合入后默认值调整的决策背景(内存优先),并留意后续是否有统一默认值的跟进 PR。
在 TokenOutput 中暴露 vLLM prefix-cache 命中统计
该 PR 值得关注,尤其对于使用 vLLM prefix-cache 或需要缓存命中统计的团队。它展示了如何在框架中暴露底层引擎的统计信息,并处理了异步恢复场景的数据一致性。建议结合实际场景评估是否需要在默认 agent loop 中透出该指标。
临时移除 Ascend CI nightly 测试作业以稳定性能指标。
此 PR 为低风险的 CI 维护变更,无需精读。建议关注后续是否完成分析并重新启用该测试作业。
参与讨论