# slime 周报 2026 第 24 周（06-08 至 06-14）

- 仓库：`THUDM/slime`
- 周期：2026-06-08 至 2026-06-14
- 来源 PR：20
- 重点 PR：20
- 生成方式：自动生成
- 原文链接：http://prhub.com.cn/THUDM/slime/reports/2026-06-08-to-2026-06-14

---

## 执行摘要

本周（2026-06-08 至 06-14）Slime 仓库共合并 20 个 PR，平均重要性 5.02，平均洞察度 3.3，整体活跃度较高。核心变化集中在 **SGLang 集成升级**、**Rollout 层稳定性增强 **和 **可观测性优化 **三大方向。作者 zhuzilin 贡献了 12 个 PR（占 60%），是本周主力推动者。此外，团队还进行了多项基础设施清理和文档更新，为后续开发奠定了更干净的基础。

## 本周重点变化

### 1. SGLang v0.5.13 升级与补丁重构
PR#2072 将 Docker 基础镜像的 SGLang 版本从 v0.5.12.post1 升级至 v0.5.13，补丁文件变动超过 1800 行。新增的 **Glm5 跨层索引共享 **通过 `is_skip_topk_layer` 和 `source_compute_layer` 函数实现跳过层复用计算，是架构级增强。同时为 Glm4MoeLite 添加了 NextN draft model 支持，并引入 decode 超时机制。该 PR 重要性高达 7.6，但存在“缺少独立测试”和“补丁变更量大”的风险，需仔细 Review。

### 2. Rollout 层可靠性增强
多 PR 共同改进了 Rollout 层的健壮性：
- **零 GPU 启动路由模式 **（PR#2057）：允许设置 `--rollout-num-gpus 0` 进入仅路由模式，不启动本地引擎，权重同步自动跳过，灵活性大增。
- **可靠服务中止机制 **（PR#2056）：通过循环调用 `/v1/loads?include=core` 轮询负载直至完全空闲，替代单次 abort 请求，确保训练流程不会被残留请求阻塞。
- **多响应 rollout_id 修复 **（PR#2031）：逐 sample 分配唯一 ID，避免 share 同一 prompt 的多个响应 ID 不一致。

### 3. 可观测性升级
PR#2027 将 wandb 指标从基于服务器端 `x_stats_open_metrics_endpoints` 采集，改为从 SGLang 生成的 trace 中提取 per-sample 性能指标，聚合后上传。PR#2070 在 `/v1/loads` 端点新增 `inflight` 维度，可返回每队列请求级明细。PR#2024 为 Placement Group 等待过程增加每 30 秒的 GPU 注册 / 可用数量日志，解决启动时长时间挂起的观测盲区。

## 模块与主题趋势

- **Docker 与 SGLang 集成（5 个 PR）**：除版本升级外，还涉及 inflight 监控暴露、sgl-router 依赖更新、以及 Mooncake 补丁的回滚（PR#2046 撤销 PR#2041）。可见团队在积极推进 SGLang 集成的深度和稳定性，但补丁管理的复杂度也随之上升。
- **Rollout 与核心训练（多个 PR 涉及 rollout.py）**：5 次修改该文件，涵盖零 GPU、abort 机制、rollout_id 修复、wandb 指标迁移。Rollout 正在从“功能可用”向“运维友好”演进。
- **基础设施（CI、环境变量等）**：PR#2055 合并并精简了 CI 测试矩阵，提高测试效率；PR#2050 统一注入 `RAY_USE_UVLOOP=0` 规避 Ray 的 uvloop 卡死问题；PR#2035 移除 wandb 中冗余的 count 字段，降低存储开销。
- **文档与生态（5 个文档 PR）**：添加 Miles、vime、ART 等生态项目，更新中英文描述，纯文档无代码改动，体现社区合作扩展。
- **多模态与新示例**：PR#2044 支持图像配置 dict 格式，PR#2030 添加 Qwen3.5-9B 全异步示例，均属于低风险增量更新。

## 风险观察

1. **测试覆盖不足**：本周 3 个 PR 明确标注“缺少测试覆盖”，包括跨层索引共享（PR#2072）、多响应 rollout_id（PR#2031）、零 GPU 模式（PR#2057）等。这些功能涉及核心逻辑，若缺少自动化测试，回归风险较高。
2. **补丁变更量大**：SGLang 补丁在升级和维护过程中变更量巨大（单 PR 改动超 1800 行），与上游版本的兼容性需要持续关注。
3. **Mooncake 补丁回滚**：PR#2046 回滚了 offloading 时的 mooncake 地址重新注册逻辑，可能导致该场景下的稳定性下降，目前无替代修复方案。
4. **性能开销**：新增的 inflight 监控（PR#2070）和 per-sample trace 采集（PR#2027）可能引入额外运行时开销，需要在压力测试中验证。
5. **内部 API 依赖**：部分功能（如 abort 机制依赖 /v1/loads 响应结构、wandb 指标依赖 trace 字段）与 SGLang 内部实现耦合，版本升级时可能需额外适配工作。

## 重点 PR 速览

| PR # | 标题 | 重要性 | 核心内容 |
|------|------|--------|----------|
| 2072 | [docker] upgrade sglang to v0.5.13 | 7.6 | 升级 SGLang，新增跨层索引共享和 draft model 支持，补丁变动大 |
| 2057 | Allow zero-GPU rollout router startup | 7.8 | 零 GPU 路由模式，跳过本地引擎和权重同步，灵活部署 |
| 2056 | Use /v1/loads to re-abort server | 7.8 | 轮询 /v1/loads 直至空闲的重试中止机制，避免残留请求 |
| 2027 | Only upload per sample stats to wandb | 8.5 | 将 wandb 指标迁移至 per-sample trace，移除服务器端采集 |
| 2055 | [ci] clean up ci | 7.0 | 合并 e2e-test-short 到 Megatron 矩阵，清理 CI 配置 |
| 2050 | Set RAY_USE_UVLOOP=0 for Ray actors | 6.2 | 统一注入环境变量规避 Ray uvloop 卡死问题 |
| 2024 | Log progress while waiting for placement group | 5.6 | 每 30 秒输出 GPU 状态日志，提升启动可观测性 |
| 2044 | support rich image config for vlm | 5.2 | 支持 dict 格式图像配置，向后兼容 |

## 后续建议

1. **加强测试覆盖**：针对跨层索引共享、零 GPU 模式、rollout_id 修复等关键功能，补充自动化测试，降低回归风险。
2. **关注补丁兼容性**：SGLang v0.5.13 补丁变更量大，应建立补丁 review 清单，特别是新增的超时逻辑和 draft model 支持部分。
3. **评估 Mooncake 回滚影响**：确认 PR#2046 是否是临时措施，如果是，应尽快提出替代方案修复 offloading 时的 mooncake 地址注册问题。
4. **验证性能开销**：在典型训练任务上测试 inflight 监控和 per-sample trace 的 CPU/ 网络开销，确保可接受。
5. **推动文档同步**：本周多个文档 PR 属于生态展示，建议将零 GPU 模式、新 wandb 指标等新功能的使用说明及时更新到用户文档中。

整体来看，本周在推进技术深度（SGLang 集成、Rollout 可靠性）的同时，也在积极清理技术和维护债务（CI、文档、环境变量），为后续快速迭代奠定了良好基础。