Prhub

radixark/miles

Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.

监控状态:已开启 最近同步:2026-09-01 16:32 同步状态:空闲 下次计划:2026-09-01 17:32

PR 列表

更多筛选
2026-08-22
功能 重要性 8.43 洞察度 6.00

Dashboard 新增 AMD SMI 遥测,NVML 优先自动回退

值得精读,尤其是 Provider 抽象、单位差异处理与降级语义的设计:`_AmdSmiProvider` 与 `_NvmlProvider` 共享同一接口而实现细节差异被干净隔离,`_amd_socket_power` 对多代 ROCm 字段兼容的思路可复用于其他硬件平台。创建类似硬件适配层时可参考本 PR 的 importlib 延迟导入与 `sys.modules` 打桩测试方式。

2026-08-21
基础设施 重要性 5.67 洞察度 6.00

ROCm CI 支持按 PR 指令覆盖镜像内置依赖

值得精读,重点是两个 workflow 文件的设计:用独立 resolver 作业做门控与布尔透传;覆盖策略“只替换命名的依赖,未命名保持镜像基线”避免意外漂移;Megatron patch 三状态探测与 fail-closed 保护。若后续要扩展 PR 指令体系,可参考此 PR 的 seam 测试与验证方法(scratch 提交 + 空提交重触发),以及 PR body 指令跨工作流消费的副作用教训。

#2676 feat(ci): acknowledge rerun-test commands

原始 PR · 作者 guapisolo · 合并时间 2026-08-21 12:34

功能 重要性 7.14 洞察度 6.00

为 /rerun-test 增加 +1 确认与 Actions 运行链接回复

建议 CI 平台方向工程师精读。值得关注的设计:dispatch 时直接请求 run details 避免轮询、以 `success_reaction` 声明式扩展反馈、反馈 job 与 dispatch job 的 token 权限隔离。对普通工程师,体感是 `/rerun-test` 有了明确确认与直达链接,调试效率提升明显。整体改动小而完整,可作为 GitHub Actions 命令网关的参考范例。

缺陷修复 重要性 4.88 洞察度 5.00

桥接模式恢复训练从检查点步骤继续

此 PR 值得精读,特别是理解桥接模式的恢复逻辑。设计上通过在参数验证阶段调整 `start_rollout_id` 的默认值,避免修改下游 `create_training_models` 的复杂逻辑,是简洁且低风险的修复。重点关注 Codex 提出的 release tracker 边界情况,未来可考虑补充处理。

基础设施 重要性 7.25 洞察度 6.00

CI 仅在实际镜像输入变化时重建 PR 镜像

建议精读。这是一个内容寻址式 CI 缓存决策的优秀范例:以输入哈希而非路径 diff 驱动重建、用一次性标签提供手动逃生舱、把注册表认证放到决策链末端。值得学习的设计决策包括:`read_label` 对 multi-arch / single-arch manifest 的递归兼容、用 `HEAD^1` 而非 base.sha 避免 base 滞后、live-label 读取规避 webhook payload 冻结问题。对同样维护昂贵 Docker 构建的团队有直接借鉴价值。

文档 重要性 4.20 洞察度 3.00

新增 Mooncake rollout 数据传输指南并挂载文档导航

值得快速浏览:对需要启用 Mooncake rollout 数据通道的团队,这是一份可直接执行的操作手册;对文档维护者,其验证流程(逐项核对 CLI 选项、shell 展开后 JSON、Mintlify 结构与导航 JSON)可作为高质量文档 PR 的样板。重点关注两处容易踩坑的细节:环境变量命名差异(示例中的 `MOONCAKE_MASTER_ADDR` 与真实环境变量 `MOONCAKE_MASTER` 的区分),以及 CUDA 13 镜像限定。

#2671 [AMD] Enable four CI tests on ROCm

原始 PR · 作者 Xinyu-Kang · 合并时间 2026-08-21 05:05

基础设施 重要性 5.01 洞察度 5.00

启用四个 AMD CI 测试并修复相关配置

此 PR 值得关注其 CI 基础设施配置方式,特别是如何通过调整 EP 解决并行度不匹配问题,以及如何在 Docker 和 CI 中统一添加依赖。对于负责 CI 维护的工程师,可从中学习到测试启用的标准流程。

参与讨论