修复 CI 失败:E2E 补 max_model_len 并注释不稳定测试
值得快速浏览,不必精读。建议与 PR#7632 成对阅读,理解 verl 团队应对 vLLM chunked prefill 校验收紧的两层策略;同时留意 vllm.yml 中被注释的 determinism 测试是否有恢复计划。
标签列表
聚合结果
修复 CI 失败:E2E 补 max_model_len 并注释不稳定测试
值得快速浏览,不必精读。建议与 PR#7632 成对阅读,理解 verl 团队应对 vLLM chunked prefill 校验收紧的两层策略;同时留意 vllm.yml 中被注释的 determinism 测试是否有恢复计划。
原始 PR · 作者 ETOgaosion · 合并时间 2026-08-31 14:13
uv 锁与镜像支持 aarch64 双架构,配套流程重写
值得精读。该 PR 展示了“架构作为解析维度而非 extra 维度”的 uv 多架构设计,以及两个非常具体的坑:nvidia-cusparselt-cu13 的 wheel 内部 tag 不一致导致 uv 反复重装、megatron-core VCS 版本号导致锁文件与实际构建不一致。这些细节对任何维护 uv 单锁多平台的团队都有借鉴价值;Docker 多架构构建与 manifest 合并的实操说明也可直接复用。重点关注 `pyproject.toml` 的 `[tool.uv]` 配置注释和 `docker/Dockerfile.uv.cu130` 的构建说明。
原始 PR · 作者 PeterYang12 · 合并时间 2026-08-31 10:01
ROCm CI 容器固定 NUMA 节点,解决 e2e 超时
值得快速阅读,但不需要精读。它展示了一个很有价值的运维经验:在虚拟化环境(QEMU VM)下,容器自由调度导致的跨 NUMA 启动开销可能被误判为计算性能问题;`--cpuset-cpus`/`--cpuset-mems` 组合是恢复 NUMA 局部性的标准手段。对于负责 CI 基础设施的工程师,建议关注:1) NUMA 拓扑感知的容器调度实践;2) YAML folded scalar 中反斜杠陷阱(作者在 PR body 中特别提醒);3) 这类硬编码硬件假设应记录到 workflow 注释或文档,以便环境迁移时更新。
Ascend 镜像改两阶段推送,规避 Quay GC 销毁中间镜像
建议镜像发布与 CI 维护同学精读该 PR:两阶段推送、digest 传递、防 GC tag、凭据隔离的组合是容器镜像 CI 的通用最佳实践。对一般训练框架使用者无需关注。后续可改进的点:将临时仓库迁移到组织级命名空间以消除单点依赖;为 merge 阶段补充 `DIGESTS` 为空时的显式失败断言;统一 a2/a3 的临时 tag 命名风格。
重组 Ascend 教程为中英目录并迁移 CI 到 a3
- 值得快速浏览 `zh/index.rst` 与 `en/index.rst` 的拆分方式,了解多语言文档在 Sphinx 中的组织模式。 - 关注 CI 迁移后第一个夜间运行的 `model_ascend.yml` 是否稳定,若 a3 镜像缺失需及时回退。 - 若团队后续维护 Ascend 文档,建议遵循 `zh/`、`en/` 目录约定,避免再次出现 `_zh/_en` 后缀冗余。
临时移除 Ascend CI nightly 测试作业以稳定性能指标。
此 PR 为低风险的 CI 维护变更,无需精读。建议关注后续是否完成分析并重新启用该测试作业。
统一进程组初始化后端为 cpu:gloo+设备后端
该 PR 值得精读,作为理解 veril 分布式初始化 back-end 处理的一个好例子。建议关注以下几点:1. 分离后端字符串的构造方式,以及如何将 CPU 操作显式路由到 Gloo。2. 如何通过对齐 ray 版本实现一致性,体现了代码复用和一致性设计。
修正 Ascend CI 步骤命名并禁用检查点保存
该 PR 属于低风险基础设施维护,建议快速合入。对于关注 CI 效率和可观测性的团队,值得了解 SAVE_FREQ=-1 在夜间任务中的使用方式。无需深度精读。